diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ecc036e87349a639d0327c993d0322670cb2d0ba
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json
@@ -0,0 +1,139 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.24140012070006034,
+ "eval_steps": 20,
+ "global_step": 100,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0127318221037568e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e10c9c9fe4bbaf8b65e834d596218c06404ac1d3
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json
@@ -0,0 +1,1084 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.4103802051901027,
+ "eval_steps": 20,
+ "global_step": 1000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0031683194745037e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f329bbea390a413dc66bf985259ab8dab4b275b2
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json
@@ -0,0 +1,1105 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.4586602293301145,
+ "eval_steps": 20,
+ "global_step": 1020,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0239715575080755e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..8d1c79dc08fd89585fd8cc3a71aef55bc9f9595e
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json
@@ -0,0 +1,1126 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.506940253470127,
+ "eval_steps": 20,
+ "global_step": 1040,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0435065133937664e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0111253307a79c355d8c8126917897c83baa926b
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json
@@ -0,0 +1,1147 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.5552202776101387,
+ "eval_steps": 20,
+ "global_step": 1060,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0627093642584269e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0257f34da4b8f3e993d73c4d394376bfa5547352
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json
@@ -0,0 +1,1168 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.603500301750151,
+ "eval_steps": 20,
+ "global_step": 1080,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.0829722584469709e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..275a789139d75e8da3fd3217959dd0f26bcf863f
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json
@@ -0,0 +1,1189 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.651780325890163,
+ "eval_steps": 20,
+ "global_step": 1100,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.102976649267794e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4198fd69705d2296cbfd15be632f706c18195298
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json
@@ -0,0 +1,1210 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.700060350030175,
+ "eval_steps": 20,
+ "global_step": 1120,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.123058232066478e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..46038d46b4e3b8a28d223c56bb29038a5f1735e2
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json
@@ -0,0 +1,1231 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.748340374170187,
+ "eval_steps": 20,
+ "global_step": 1140,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.141886791596626e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..a8dce921e9db896b938d62e71a0cb7ccf6d7bab0
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json
@@ -0,0 +1,1252 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.796620398310199,
+ "eval_steps": 20,
+ "global_step": 1160,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.1627016981849907e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..09d11725f6f4868c08785f0f31f647d59e525eea
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json
@@ -0,0 +1,1273 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.8449004224502112,
+ "eval_steps": 20,
+ "global_step": 1180,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.1821567693494067e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f131523f6622afe9f5febb16b447632b7c852cbd
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json
@@ -0,0 +1,160 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.28968014484007243,
+ "eval_steps": 20,
+ "global_step": 120,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.2278999724859392e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e4f56b396f4cf722f14498333e1513140cf50226
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json
@@ -0,0 +1,1294 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.8931804465902236,
+ "eval_steps": 20,
+ "global_step": 1200,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.202393633684951e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0f861783a8513552d6db099d26e9e700ed1ef3a0
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json
@@ -0,0 +1,1315 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.9414604707302354,
+ "eval_steps": 20,
+ "global_step": 1220,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.22275795454208e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0ba6d4f23ebf4c7f726c8e6fb64e39b4db05eec9
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json
@@ -0,0 +1,1336 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 2.9897404948702473,
+ "eval_steps": 20,
+ "global_step": 1240,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.2419491368519475e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ed4e1da389ad8d604f86c0c4b5e35136799f708e
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json
@@ -0,0 +1,1357 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.036210018105009,
+ "eval_steps": 20,
+ "global_step": 1260,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.2612962738845286e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..57a0658bbf82b1e95bf74bf042c63bae5361b7ec
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json
@@ -0,0 +1,1378 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.084490042245021,
+ "eval_steps": 20,
+ "global_step": 1280,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.2835248707651174e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..2f0affb86e303161e5006b41ff37058a58fcc41e
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json
@@ -0,0 +1,1399 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.1327700663850333,
+ "eval_steps": 20,
+ "global_step": 1300,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.3048837115230618e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..dd41560cc02589cf90577156d8b7c800a2e5af28
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json
@@ -0,0 +1,1420 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.181050090525045,
+ "eval_steps": 20,
+ "global_step": 1320,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.326625819426898e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f4acabad58753fbfbc178d0b9274e94dbc689bdd
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json
@@ -0,0 +1,1441 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.2293301146650575,
+ "eval_steps": 20,
+ "global_step": 1340,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.345957024394281e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c043b7a028490c807463aab4b8fc8966566842fd
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json
@@ -0,0 +1,1462 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.2776101388050694,
+ "eval_steps": 20,
+ "global_step": 1360,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.3663042912097894e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..957854d293c6f9d48ee1d82af92b96066ed35c91
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json
@@ -0,0 +1,1483 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.3258901629450817,
+ "eval_steps": 20,
+ "global_step": 1380,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.3850107797051802e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5b282ec27f6c30aaece0783991f4d868e9b437be
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json
@@ -0,0 +1,181 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.33796016898008446,
+ "eval_steps": 20,
+ "global_step": 140,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.4496025135521792e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ebaff554059785743429b837a43e2e40054c9854
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json
@@ -0,0 +1,1504 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.3741701870850935,
+ "eval_steps": 20,
+ "global_step": 1400,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.4040125723949466e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..2e3a96db25b559fbbfd20878c9621d4d63eba4b9
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json
@@ -0,0 +1,1525 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.4224502112251054,
+ "eval_steps": 20,
+ "global_step": 1420,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.4238859163696333e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e1f02caa202e9bd6910bd5befa5f3b552788b5f4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json
@@ -0,0 +1,1546 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.4707302353651177,
+ "eval_steps": 20,
+ "global_step": 1440,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.4433804811041178e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..11d416f646df5ae460a1f9adf36551579293eb1d
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json
@@ -0,0 +1,1567 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.51901025950513,
+ "eval_steps": 20,
+ "global_step": 1460,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.463979070638244e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..70d1d09b0ae9c0b9a0c79e64cf64569035fc29b5
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json
@@ -0,0 +1,1588 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.567290283645142,
+ "eval_steps": 20,
+ "global_step": 1480,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.4846844723277824e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4388d2e8803dc4c690037a01a10761ff8ca98509
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json
@@ -0,0 +1,1609 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.6155703077851538,
+ "eval_steps": 20,
+ "global_step": 1500,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.504547942909952e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..85d87221ccc2fb5905a3a31bdc863756b734e02a
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json
@@ -0,0 +1,1630 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.663850331925166,
+ "eval_steps": 20,
+ "global_step": 1520,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.5236305179021312e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b21ffc7cc9e7cf80527877e44e9aaf6ffa7f1d36
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json
@@ -0,0 +1,1651 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.712130356065178,
+ "eval_steps": 20,
+ "global_step": 1540,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.544052283952087e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f23b17b0fc8777d6f3a042c826c3da2338e99c9e
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json
@@ -0,0 +1,1672 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.7604103802051903,
+ "eval_steps": 20,
+ "global_step": 1560,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.5635917277434675e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c1375941d51c9a44bb7ae7cfb11a9ff8ab5ce42b
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json
@@ -0,0 +1,1693 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.808690404345202,
+ "eval_steps": 20,
+ "global_step": 1580,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.58275059713237e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d04df3a93d23b659196202f272ca014cff2246a2
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json
@@ -0,0 +1,202 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.38624019312009655,
+ "eval_steps": 20,
+ "global_step": 160,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6420618611449856e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ed6fb502590ff22047fec334cfb36728afd7a77f
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json
@@ -0,0 +1,1714 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.856970428485214,
+ "eval_steps": 20,
+ "global_step": 1600,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6031894172239462e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b52b40f924bd4c06c11b91332f1fabc8db1b37a0
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json
@@ -0,0 +1,1735 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.9052504526252263,
+ "eval_steps": 20,
+ "global_step": 1620,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6233042105247334e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d4e98591dd813af138359498f4ffb138190852d2
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json
@@ -0,0 +1,1756 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.9535304767652386,
+ "eval_steps": 20,
+ "global_step": 1640,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6434764490183475e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..da84d5f35ebd04d3e3010e4a2ea6c306fadc3b5f
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json
@@ -0,0 +1,1777 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.0,
+ "eval_steps": 20,
+ "global_step": 1660,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6623734491102618e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..2aadd1d233280d318896048ad0322373d755ff98
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json
@@ -0,0 +1,1798 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.048280024140012,
+ "eval_steps": 20,
+ "global_step": 1680,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6830788507998003e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..fc6a9c8c7684b2886f6b5058f1d88e17175569d6
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json
@@ -0,0 +1,1819 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.096560048280024,
+ "eval_steps": 20,
+ "global_step": 1700,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7021515523994624e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0ff7bf87334d99140ff56806457cf9b57c4b81d2
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json
@@ -0,0 +1,1840 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.1448400724200365,
+ "eval_steps": 20,
+ "global_step": 1720,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ },
+ {
+ "entropy": 0.41640330031514167,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.752216100692749,
+ "learning_rate": 0.00026559521516965437,
+ "loss": 0.39748263359069824,
+ "mean_token_accuracy": 0.8684553548693656,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.469178682297803,
+ "eval_loss": 0.7004125714302063,
+ "eval_mean_token_accuracy": 0.8194386949030201,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 89.8428,
+ "eval_samples_per_second": 15.805,
+ "eval_steps_per_second": 1.981,
+ "step": 1720
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7232312454235136e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5826899c7584526b8913fb08fb5f8543f662ccfc
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json
@@ -0,0 +1,1861 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.193120096560048,
+ "eval_steps": 20,
+ "global_step": 1740,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ },
+ {
+ "entropy": 0.41640330031514167,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.752216100692749,
+ "learning_rate": 0.00026559521516965437,
+ "loss": 0.39748263359069824,
+ "mean_token_accuracy": 0.8684553548693656,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.469178682297803,
+ "eval_loss": 0.7004125714302063,
+ "eval_mean_token_accuracy": 0.8194386949030201,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 89.8428,
+ "eval_samples_per_second": 15.805,
+ "eval_steps_per_second": 1.981,
+ "step": 1720
+ },
+ {
+ "entropy": 0.42079071439802646,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.8349477648735046,
+ "learning_rate": 0.0002628539890974329,
+ "loss": 0.40129623413085935,
+ "mean_token_accuracy": 0.8686790131032467,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48358210871058904,
+ "eval_loss": 0.70196533203125,
+ "eval_mean_token_accuracy": 0.818096743875675,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 90.444,
+ "eval_samples_per_second": 15.7,
+ "eval_steps_per_second": 1.968,
+ "step": 1740
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7427670988903424e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5fc7697618ec4d88bdaad248c9b2778e9253e34f
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json
@@ -0,0 +1,1882 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.24140012070006,
+ "eval_steps": 20,
+ "global_step": 1760,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ },
+ {
+ "entropy": 0.41640330031514167,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.752216100692749,
+ "learning_rate": 0.00026559521516965437,
+ "loss": 0.39748263359069824,
+ "mean_token_accuracy": 0.8684553548693656,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.469178682297803,
+ "eval_loss": 0.7004125714302063,
+ "eval_mean_token_accuracy": 0.8194386949030201,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 89.8428,
+ "eval_samples_per_second": 15.805,
+ "eval_steps_per_second": 1.981,
+ "step": 1720
+ },
+ {
+ "entropy": 0.42079071439802646,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.8349477648735046,
+ "learning_rate": 0.0002628539890974329,
+ "loss": 0.40129623413085935,
+ "mean_token_accuracy": 0.8686790131032467,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48358210871058904,
+ "eval_loss": 0.70196533203125,
+ "eval_mean_token_accuracy": 0.818096743875675,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 90.444,
+ "eval_samples_per_second": 15.7,
+ "eval_steps_per_second": 1.968,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4285690750926733,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.781974732875824,
+ "learning_rate": 0.00026008998449779933,
+ "loss": 0.40457854270935056,
+ "mean_token_accuracy": 0.8679066866636276,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.4653420230645812,
+ "eval_loss": 0.7041526436805725,
+ "eval_mean_token_accuracy": 0.8190121017815022,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 89.5248,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.988,
+ "step": 1760
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.762383734659584e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e38fe58ce735f34392ef88999f08a9043898ee91
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json
@@ -0,0 +1,1903 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.289680144840072,
+ "eval_steps": 20,
+ "global_step": 1780,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ },
+ {
+ "entropy": 0.41640330031514167,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.752216100692749,
+ "learning_rate": 0.00026559521516965437,
+ "loss": 0.39748263359069824,
+ "mean_token_accuracy": 0.8684553548693656,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.469178682297803,
+ "eval_loss": 0.7004125714302063,
+ "eval_mean_token_accuracy": 0.8194386949030201,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 89.8428,
+ "eval_samples_per_second": 15.805,
+ "eval_steps_per_second": 1.981,
+ "step": 1720
+ },
+ {
+ "entropy": 0.42079071439802646,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.8349477648735046,
+ "learning_rate": 0.0002628539890974329,
+ "loss": 0.40129623413085935,
+ "mean_token_accuracy": 0.8686790131032467,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48358210871058904,
+ "eval_loss": 0.70196533203125,
+ "eval_mean_token_accuracy": 0.818096743875675,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 90.444,
+ "eval_samples_per_second": 15.7,
+ "eval_steps_per_second": 1.968,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4285690750926733,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.781974732875824,
+ "learning_rate": 0.00026008998449779933,
+ "loss": 0.40457854270935056,
+ "mean_token_accuracy": 0.8679066866636276,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.4653420230645812,
+ "eval_loss": 0.7041526436805725,
+ "eval_mean_token_accuracy": 0.8190121017815022,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 89.5248,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.988,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4335357129573822,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.8383703827857971,
+ "learning_rate": 0.0002573039835513604,
+ "loss": 0.41876921653747556,
+ "mean_token_accuracy": 0.8663770146667957,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.5015502416350869,
+ "eval_loss": 0.6904259324073792,
+ "eval_mean_token_accuracy": 0.8200626497188311,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 89.7014,
+ "eval_samples_per_second": 15.83,
+ "eval_steps_per_second": 1.984,
+ "step": 1780
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7824312093750272e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..682e10525879325be7ac4fbf6d19b21dbab6235f
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json
@@ -0,0 +1,223 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.43452021726010864,
+ "eval_steps": 20,
+ "global_step": 180,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.842464801808384e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.02728394274790723,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4f3aa1833d1bf90351e208e3b574def2714cbdc5
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json
@@ -0,0 +1,1924 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.337960168980085,
+ "eval_steps": 20,
+ "global_step": 1800,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.024795526266098,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.945375919342041,
+ "learning_rate": 1.6698127428345936e-05,
+ "loss": 1.7825420379638672,
+ "mean_token_accuracy": 0.6315708436071873,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.29921497588747,
+ "eval_loss": 1.169131875038147,
+ "eval_mean_token_accuracy": 0.7185706342204233,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 91.7898,
+ "eval_samples_per_second": 15.47,
+ "eval_steps_per_second": 1.939,
+ "step": 20
+ },
+ {
+ "entropy": 1.0346344470977784,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.7916979789733887,
+ "learning_rate": 3.427510366871008e-05,
+ "loss": 0.9480395317077637,
+ "mean_token_accuracy": 0.7543429024517536,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 0.9673695430326997,
+ "eval_loss": 0.8588430285453796,
+ "eval_mean_token_accuracy": 0.7737233002534073,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 89.8219,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 40
+ },
+ {
+ "entropy": 0.8977566614747048,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7972187995910645,
+ "learning_rate": 5.185207990907422e-05,
+ "loss": 0.8029604911804199,
+ "mean_token_accuracy": 0.7818016350269318,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8436836982041263,
+ "eval_loss": 0.7893033623695374,
+ "eval_mean_token_accuracy": 0.7858914984076211,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 89.9349,
+ "eval_samples_per_second": 15.789,
+ "eval_steps_per_second": 1.979,
+ "step": 60
+ },
+ {
+ "entropy": 0.8650321319699288,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.2128729820251465,
+ "learning_rate": 6.942905614943836e-05,
+ "loss": 0.77417893409729,
+ "mean_token_accuracy": 0.7875479467213153,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8209857180547179,
+ "eval_loss": 0.7572280168533325,
+ "eval_mean_token_accuracy": 0.7925970383574453,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 89.9459,
+ "eval_samples_per_second": 15.787,
+ "eval_steps_per_second": 1.979,
+ "step": 80
+ },
+ {
+ "entropy": 0.8096660938113928,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.1254287958145142,
+ "learning_rate": 8.700603238980251e-05,
+ "loss": 0.7170331001281738,
+ "mean_token_accuracy": 0.7994555257260799,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.792780208788561,
+ "eval_loss": 0.7442984580993652,
+ "eval_mean_token_accuracy": 0.7954704573984896,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 90.294,
+ "eval_samples_per_second": 15.726,
+ "eval_steps_per_second": 1.971,
+ "step": 100
+ },
+ {
+ "entropy": 0.7979829199612141,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2140507698059082,
+ "learning_rate": 0.00010458300863016666,
+ "loss": 0.7141861915588379,
+ "mean_token_accuracy": 0.8000014744699001,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.7938692486018277,
+ "eval_loss": 0.7279797196388245,
+ "eval_mean_token_accuracy": 0.7989798734027348,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 89.7189,
+ "eval_samples_per_second": 15.827,
+ "eval_steps_per_second": 1.984,
+ "step": 120
+ },
+ {
+ "entropy": 0.7916347607970238,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.0506458282470703,
+ "learning_rate": 0.0001221599848705308,
+ "loss": 0.7117055416107178,
+ "mean_token_accuracy": 0.7970046654343605,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.8052781063519167,
+ "eval_loss": 0.722576916217804,
+ "eval_mean_token_accuracy": 0.7982530523551984,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 90.0376,
+ "eval_samples_per_second": 15.771,
+ "eval_steps_per_second": 1.977,
+ "step": 140
+ },
+ {
+ "entropy": 0.7880666613578796,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8409207463264465,
+ "learning_rate": 0.00013973696111089492,
+ "loss": 0.7052523136138916,
+ "mean_token_accuracy": 0.8000123649835587,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7787443134891853,
+ "eval_loss": 0.7137772440910339,
+ "eval_mean_token_accuracy": 0.8014209287220173,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 90.2562,
+ "eval_samples_per_second": 15.733,
+ "eval_steps_per_second": 1.972,
+ "step": 160
+ },
+ {
+ "entropy": 0.7696007996797561,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.0182477235794067,
+ "learning_rate": 0.00015731393735125907,
+ "loss": 0.7008797645568847,
+ "mean_token_accuracy": 0.8007259473204613,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.752259682068664,
+ "eval_loss": 0.7171286344528198,
+ "eval_mean_token_accuracy": 0.80052122574174,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 90.0797,
+ "eval_samples_per_second": 15.764,
+ "eval_steps_per_second": 1.976,
+ "step": 180
+ },
+ {
+ "entropy": 0.7828126326203346,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9553632736206055,
+ "learning_rate": 0.0001748909135916232,
+ "loss": 0.7046853542327881,
+ "mean_token_accuracy": 0.7988562889397144,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7389638169427936,
+ "eval_loss": 0.7187935709953308,
+ "eval_mean_token_accuracy": 0.7995899999409579,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 89.9223,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.979,
+ "step": 200
+ },
+ {
+ "entropy": 0.7909286297857762,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 1.134459376335144,
+ "learning_rate": 0.00019246788983198735,
+ "loss": 0.6989312171936035,
+ "mean_token_accuracy": 0.7991565138101577,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7496965199374082,
+ "eval_loss": 0.7106321454048157,
+ "eval_mean_token_accuracy": 0.8046183442131857,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 89.6899,
+ "eval_samples_per_second": 15.832,
+ "eval_steps_per_second": 1.985,
+ "step": 220
+ },
+ {
+ "entropy": 0.7651963323354721,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.9557585716247559,
+ "learning_rate": 0.0002100448660723515,
+ "loss": 0.6984559059143066,
+ "mean_token_accuracy": 0.8019823372364044,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7615563079212488,
+ "eval_loss": 0.7098539471626282,
+ "eval_mean_token_accuracy": 0.8047233508544022,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 90.3752,
+ "eval_samples_per_second": 15.712,
+ "eval_steps_per_second": 1.97,
+ "step": 240
+ },
+ {
+ "entropy": 0.787507726252079,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.9279311299324036,
+ "learning_rate": 0.00022762184231271568,
+ "loss": 0.708138370513916,
+ "mean_token_accuracy": 0.8013308703899383,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7856640896100676,
+ "eval_loss": 0.7191570401191711,
+ "eval_mean_token_accuracy": 0.8024677249153008,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 93.7336,
+ "eval_samples_per_second": 15.149,
+ "eval_steps_per_second": 1.899,
+ "step": 260
+ },
+ {
+ "entropy": 0.768489234894514,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.7992776036262512,
+ "learning_rate": 0.0002451988185530798,
+ "loss": 0.7035849571228028,
+ "mean_token_accuracy": 0.8031105332076549,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7682498740346244,
+ "eval_loss": 0.7149022221565247,
+ "eval_mean_token_accuracy": 0.7973497995499814,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 89.7309,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 280
+ },
+ {
+ "entropy": 0.7720955617725849,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.1931514739990234,
+ "learning_rate": 0.0002627757947934439,
+ "loss": 0.6965402603149414,
+ "mean_token_accuracy": 0.8040348663926125,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7214708304807042,
+ "eval_loss": 0.7350823879241943,
+ "eval_mean_token_accuracy": 0.7942911925610532,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 89.6451,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 300
+ },
+ {
+ "entropy": 0.7930095426738262,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8994467258453369,
+ "learning_rate": 0.0002803527710338081,
+ "loss": 0.7331492900848389,
+ "mean_token_accuracy": 0.796185302734375,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.8142535488926963,
+ "eval_loss": 0.7237834334373474,
+ "eval_mean_token_accuracy": 0.799495273761535,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 90.6759,
+ "eval_samples_per_second": 15.66,
+ "eval_steps_per_second": 1.963,
+ "step": 320
+ },
+ {
+ "entropy": 0.7825102441012859,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 1.8224239349365234,
+ "learning_rate": 0.00029792974727417223,
+ "loss": 0.7331175804138184,
+ "mean_token_accuracy": 0.7977667152881622,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7327135443017724,
+ "eval_loss": 0.7388784289360046,
+ "eval_mean_token_accuracy": 0.8007041252730938,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 89.7692,
+ "eval_samples_per_second": 15.818,
+ "eval_steps_per_second": 1.983,
+ "step": 340
+ },
+ {
+ "entropy": 0.819331557303667,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 1.0407779216766357,
+ "learning_rate": 0.0003155067235145364,
+ "loss": 0.7456695556640625,
+ "mean_token_accuracy": 0.7936980701982975,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.8065585420372781,
+ "eval_loss": 0.735519528388977,
+ "eval_mean_token_accuracy": 0.7974206296245704,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 89.4336,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.99,
+ "step": 360
+ },
+ {
+ "entropy": 0.8114653021097183,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.1209490299224854,
+ "learning_rate": 0.0003330836997549005,
+ "loss": 0.7340899467468261,
+ "mean_token_accuracy": 0.7914272703230381,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.8025527285056168,
+ "eval_loss": 0.7295576930046082,
+ "eval_mean_token_accuracy": 0.7990576628218876,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 89.9579,
+ "eval_samples_per_second": 15.785,
+ "eval_steps_per_second": 1.979,
+ "step": 380
+ },
+ {
+ "entropy": 0.8042497783899307,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 1.2437798976898193,
+ "learning_rate": 0.0003506606759952647,
+ "loss": 0.7381744384765625,
+ "mean_token_accuracy": 0.7967362694442273,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7717011336530193,
+ "eval_loss": 0.7436173558235168,
+ "eval_mean_token_accuracy": 0.7975849482450592,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 89.8411,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 400
+ },
+ {
+ "entropy": 0.7987750010056929,
+ "epoch": 1.012070006035003,
+ "grad_norm": 1.2390918731689453,
+ "learning_rate": 0.000364721224843344,
+ "loss": 0.7317790031433106,
+ "mean_token_accuracy": 0.7986087551364651,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7333170604170038,
+ "eval_loss": 0.7456948757171631,
+ "eval_mean_token_accuracy": 0.7964897577682238,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 89.7288,
+ "eval_samples_per_second": 15.825,
+ "eval_steps_per_second": 1.984,
+ "step": 420
+ },
+ {
+ "entropy": 0.7372976846992969,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.1552740335464478,
+ "learning_rate": 0.00036468510102269575,
+ "loss": 0.6734249114990234,
+ "mean_token_accuracy": 0.805834824591875,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.7130355526891987,
+ "eval_loss": 0.7555333375930786,
+ "eval_mean_token_accuracy": 0.7961652781186479,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 89.8713,
+ "eval_samples_per_second": 15.8,
+ "eval_steps_per_second": 1.981,
+ "step": 440
+ },
+ {
+ "entropy": 0.7465668715536594,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 1.1991469860076904,
+ "learning_rate": 0.0003645973816745066,
+ "loss": 0.6871879577636719,
+ "mean_token_accuracy": 0.8042450234293937,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7772979542110743,
+ "eval_loss": 0.7561826705932617,
+ "eval_mean_token_accuracy": 0.7953876427720102,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 89.8395,
+ "eval_samples_per_second": 15.806,
+ "eval_steps_per_second": 1.981,
+ "step": 460
+ },
+ {
+ "entropy": 0.7477855801582336,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 1.325486660003662,
+ "learning_rate": 0.00036445809162231435,
+ "loss": 0.6836830139160156,
+ "mean_token_accuracy": 0.8021619468927383,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.7098110676481483,
+ "eval_loss": 0.758007287979126,
+ "eval_mean_token_accuracy": 0.7909953189030122,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 89.6101,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.986,
+ "step": 480
+ },
+ {
+ "entropy": 0.7632691070437432,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 1.0122262239456177,
+ "learning_rate": 0.0003642672702835562,
+ "loss": 0.7071213245391845,
+ "mean_token_accuracy": 0.8000680930912495,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7645382720432924,
+ "eval_loss": 0.7492606043815613,
+ "eval_mean_token_accuracy": 0.7976858676149604,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 89.6092,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.986,
+ "step": 500
+ },
+ {
+ "entropy": 0.7623726457357407,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.367774486541748,
+ "learning_rate": 0.00036402497165841384,
+ "loss": 0.6965175151824952,
+ "mean_token_accuracy": 0.8016501650214195,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7868083715438843,
+ "eval_loss": 0.7481449842453003,
+ "eval_mean_token_accuracy": 0.799330582779445,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 89.8241,
+ "eval_samples_per_second": 15.809,
+ "eval_steps_per_second": 1.982,
+ "step": 520
+ },
+ {
+ "entropy": 0.7535207405686378,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 1.213614821434021,
+ "learning_rate": 0.00036373126431453207,
+ "loss": 0.7078310489654541,
+ "mean_token_accuracy": 0.7998907208442688,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7829091950748743,
+ "eval_loss": 0.7416072487831116,
+ "eval_mean_token_accuracy": 0.7969146250339036,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 89.4607,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 540
+ },
+ {
+ "entropy": 0.7527363449335098,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 1.0929982662200928,
+ "learning_rate": 0.00036338623136761495,
+ "loss": 0.7058369636535644,
+ "mean_token_accuracy": 0.7997087433934211,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.728419938114252,
+ "eval_loss": 0.744873046875,
+ "eval_mean_token_accuracy": 0.7966634296299366,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 89.6597,
+ "eval_samples_per_second": 15.838,
+ "eval_steps_per_second": 1.985,
+ "step": 560
+ },
+ {
+ "entropy": 0.7406099259853363,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.409364104270935,
+ "learning_rate": 0.00036298997045790515,
+ "loss": 0.6902852058410645,
+ "mean_token_accuracy": 0.805386807769537,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.6991632758231645,
+ "eval_loss": 0.7480319738388062,
+ "eval_mean_token_accuracy": 0.7970068006033308,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 89.8329,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 580
+ },
+ {
+ "entropy": 0.7459449704736472,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.7053111791610718,
+ "learning_rate": 0.00036254259372255277,
+ "loss": 0.7044640064239502,
+ "mean_token_accuracy": 0.8005018755793571,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7454566660891758,
+ "eval_loss": 0.7551484704017639,
+ "eval_mean_token_accuracy": 0.7897093731365846,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 89.8313,
+ "eval_samples_per_second": 15.807,
+ "eval_steps_per_second": 1.981,
+ "step": 600
+ },
+ {
+ "entropy": 0.7621391348540782,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 1.174443244934082,
+ "learning_rate": 0.000362044227763882,
+ "loss": 0.7111573696136475,
+ "mean_token_accuracy": 0.798752411454916,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7664387949397055,
+ "eval_loss": 0.7365804314613342,
+ "eval_mean_token_accuracy": 0.7963101200843126,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 89.9623,
+ "eval_samples_per_second": 15.784,
+ "eval_steps_per_second": 1.979,
+ "step": 620
+ },
+ {
+ "entropy": 0.7424944408237935,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.2898184061050415,
+ "learning_rate": 0.000361495013613564,
+ "loss": 0.6913110733032226,
+ "mean_token_accuracy": 0.8009015507996082,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7255479529332579,
+ "eval_loss": 0.7345991730690002,
+ "eval_mean_token_accuracy": 0.8013592945056015,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 89.817,
+ "eval_samples_per_second": 15.81,
+ "eval_steps_per_second": 1.982,
+ "step": 640
+ },
+ {
+ "entropy": 0.7303367637097835,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.1310476064682007,
+ "learning_rate": 0.00036089510669270666,
+ "loss": 0.6875617027282714,
+ "mean_token_accuracy": 0.8035397171974182,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7101308248016271,
+ "eval_loss": 0.7394917011260986,
+ "eval_mean_token_accuracy": 0.7990792942850777,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 89.7431,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.983,
+ "step": 660
+ },
+ {
+ "entropy": 0.7387678384780884,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.9645389914512634,
+ "learning_rate": 0.0003602446767678725,
+ "loss": 0.6911204338073731,
+ "mean_token_accuracy": 0.8056333385407924,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7281073737010527,
+ "eval_loss": 0.7376708984375,
+ "eval_mean_token_accuracy": 0.7997356415464637,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 90.0338,
+ "eval_samples_per_second": 15.772,
+ "eval_steps_per_second": 1.977,
+ "step": 680
+ },
+ {
+ "entropy": 0.7449554048478604,
+ "epoch": 1.687990343995172,
+ "grad_norm": 1.9069629907608032,
+ "learning_rate": 0.0003595439079030364,
+ "loss": 0.7042286396026611,
+ "mean_token_accuracy": 0.8018639378249646,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7022633817088738,
+ "eval_loss": 0.7320939898490906,
+ "eval_mean_token_accuracy": 0.8006051541044471,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 89.8948,
+ "eval_samples_per_second": 15.796,
+ "eval_steps_per_second": 1.98,
+ "step": 700
+ },
+ {
+ "entropy": 0.723249051719904,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.8333877325057983,
+ "learning_rate": 0.00035879299840749777,
+ "loss": 0.7043714046478271,
+ "mean_token_accuracy": 0.8028345607221127,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.672436946898364,
+ "eval_loss": 0.713233470916748,
+ "eval_mean_token_accuracy": 0.8047760577684038,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 89.6394,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 720
+ },
+ {
+ "entropy": 0.730014206469059,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.4580037593841553,
+ "learning_rate": 0.00035799216077976137,
+ "loss": 0.6985176563262939,
+ "mean_token_accuracy": 0.8015547141432762,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.6908873795123582,
+ "eval_loss": 0.7198202013969421,
+ "eval_mean_token_accuracy": 0.8024131682481659,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 89.3771,
+ "eval_samples_per_second": 15.888,
+ "eval_steps_per_second": 1.992,
+ "step": 740
+ },
+ {
+ "entropy": 0.7219605796039105,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.51682710647583,
+ "learning_rate": 0.000357141621647403,
+ "loss": 0.6844424724578857,
+ "mean_token_accuracy": 0.8032813094556331,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7113401109582922,
+ "eval_loss": 0.7195309400558472,
+ "eval_mean_token_accuracy": 0.8019187035185568,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 89.4658,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.729826743900776,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 1.0838000774383545,
+ "learning_rate": 0.0003562416217029361,
+ "loss": 0.685858678817749,
+ "mean_token_accuracy": 0.8050567395985126,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.649370267484965,
+ "eval_loss": 0.7177029252052307,
+ "eval_mean_token_accuracy": 0.8050174043419656,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 89.2287,
+ "eval_samples_per_second": 15.914,
+ "eval_steps_per_second": 1.995,
+ "step": 780
+ },
+ {
+ "entropy": 0.6799364153295755,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 1.1364924907684326,
+ "learning_rate": 0.00035529241563569903,
+ "loss": 0.6714428901672364,
+ "mean_token_accuracy": 0.8087341658771038,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6603799047095052,
+ "eval_loss": 0.7201809287071228,
+ "eval_mean_token_accuracy": 0.802863868769635,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 89.2718,
+ "eval_samples_per_second": 15.906,
+ "eval_steps_per_second": 1.994,
+ "step": 800
+ },
+ {
+ "entropy": 0.7078610375523567,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 1.2191942930221558,
+ "learning_rate": 0.0003542942720597808,
+ "loss": 0.6996590614318847,
+ "mean_token_accuracy": 0.8049512051045895,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.7240545264120852,
+ "eval_loss": 0.7301309108734131,
+ "eval_mean_token_accuracy": 0.8015973166133581,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 89.3438,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.992,
+ "step": 820
+ },
+ {
+ "entropy": 0.6557391556826505,
+ "epoch": 2.024140012070006,
+ "grad_norm": 1.36203134059906,
+ "learning_rate": 0.0003532474734380064,
+ "loss": 0.6327113628387451,
+ "mean_token_accuracy": 0.8142829847026181,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6573808648613062,
+ "eval_loss": 0.7334365844726562,
+ "eval_mean_token_accuracy": 0.8043633893634496,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 89.3359,
+ "eval_samples_per_second": 15.895,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.6409128502011299,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 1.5804955959320068,
+ "learning_rate": 0.0003521523160020035,
+ "loss": 0.6023559093475341,
+ "mean_token_accuracy": 0.8222251623868942,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6983234788594621,
+ "eval_loss": 0.7232135534286499,
+ "eval_mean_token_accuracy": 0.8010654268639811,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 89.2615,
+ "eval_samples_per_second": 15.908,
+ "eval_steps_per_second": 1.994,
+ "step": 860
+ },
+ {
+ "entropy": 0.6151149723678827,
+ "epoch": 2.12070006035003,
+ "grad_norm": 1.1975436210632324,
+ "learning_rate": 0.00035100910966837193,
+ "loss": 0.5803564548492431,
+ "mean_token_accuracy": 0.8256325736641884,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6636555573243773,
+ "eval_loss": 0.7205662727355957,
+ "eval_mean_token_accuracy": 0.8036768369460374,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 89.2957,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.993,
+ "step": 880
+ },
+ {
+ "entropy": 0.6201727617532015,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9907131195068359,
+ "learning_rate": 0.0003498181779509813,
+ "loss": 0.6101872444152832,
+ "mean_token_accuracy": 0.8196512959897518,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.6473788086617931,
+ "eval_loss": 0.7062397003173828,
+ "eval_mean_token_accuracy": 0.8078362184963869,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 88.6198,
+ "eval_samples_per_second": 16.024,
+ "eval_steps_per_second": 2.009,
+ "step": 900
+ },
+ {
+ "entropy": 0.6097332935780286,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.9055633544921875,
+ "learning_rate": 0.00034857985786942026,
+ "loss": 0.5956094264984131,
+ "mean_token_accuracy": 0.8240575887262821,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.612629868341296,
+ "eval_loss": 0.7106770277023315,
+ "eval_mean_token_accuracy": 0.805324277181304,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 89.4383,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 920
+ },
+ {
+ "entropy": 0.6182701248675585,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.9513736367225647,
+ "learning_rate": 0.00034729449985362404,
+ "loss": 0.6019269466400147,
+ "mean_token_accuracy": 0.8187106013298034,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6437647456533453,
+ "eval_loss": 0.7173502445220947,
+ "eval_mean_token_accuracy": 0.8056439573175451,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.9568,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 2.001,
+ "step": 940
+ },
+ {
+ "entropy": 0.6508570514619351,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.9606207013130188,
+ "learning_rate": 0.0003459624676447067,
+ "loss": 0.6296409606933594,
+ "mean_token_accuracy": 0.8167732007801533,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6288247135248077,
+ "eval_loss": 0.7160675525665283,
+ "eval_mean_token_accuracy": 0.8066010689467527,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 89.0044,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 2.0,
+ "step": 960
+ },
+ {
+ "entropy": 0.6380081418901682,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.9677181839942932,
+ "learning_rate": 0.000344584138192027,
+ "loss": 0.6210546493530273,
+ "mean_token_accuracy": 0.8186135642230511,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6407805031604981,
+ "eval_loss": 0.7055043578147888,
+ "eval_mean_token_accuracy": 0.8070103157772107,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 89.5606,
+ "eval_samples_per_second": 15.855,
+ "eval_steps_per_second": 1.987,
+ "step": 980
+ },
+ {
+ "entropy": 0.6310251638293266,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 2.1046407222747803,
+ "learning_rate": 0.000343159901546516,
+ "loss": 0.6165830135345459,
+ "mean_token_accuracy": 0.8207855716347694,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6461507470420237,
+ "eval_loss": 0.7292136549949646,
+ "eval_mean_token_accuracy": 0.8030418261383356,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 89.315,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.993,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6256617344915867,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 1.1768349409103394,
+ "learning_rate": 0.0003416901607502972,
+ "loss": 0.6142709255218506,
+ "mean_token_accuracy": 0.8220669947564602,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6150523993406403,
+ "eval_loss": 0.7019563317298889,
+ "eval_mean_token_accuracy": 0.8094323099998946,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 89.419,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.991,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6126735735684633,
+ "epoch": 2.506940253470127,
+ "grad_norm": 1.8065496683120728,
+ "learning_rate": 0.00034017533172263055,
+ "loss": 0.6056458473205566,
+ "mean_token_accuracy": 0.8203762136399746,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6544345456562685,
+ "eval_loss": 0.7086517214775085,
+ "eval_mean_token_accuracy": 0.806709805901131,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 88.981,
+ "eval_samples_per_second": 15.958,
+ "eval_steps_per_second": 2.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6311754353344441,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 1.0576369762420654,
+ "learning_rate": 0.00033861584314221236,
+ "loss": 0.6176392555236816,
+ "mean_token_accuracy": 0.8177410490810871,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6273799200406235,
+ "eval_loss": 0.708163321018219,
+ "eval_mean_token_accuracy": 0.8032017099053672,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 89.7668,
+ "eval_samples_per_second": 15.819,
+ "eval_steps_per_second": 1.983,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6200249589979648,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.997065007686615,
+ "learning_rate": 0.0003370121363258637,
+ "loss": 0.6203888893127442,
+ "mean_token_accuracy": 0.8196275025606156,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6457576811983344,
+ "eval_loss": 0.6972290277481079,
+ "eval_mean_token_accuracy": 0.8095980849158898,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 89.2027,
+ "eval_samples_per_second": 15.919,
+ "eval_steps_per_second": 1.995,
+ "step": 1080
+ },
+ {
+ "entropy": 0.626810473203659,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.865475058555603,
+ "learning_rate": 0.0003353646651036438,
+ "loss": 0.6102585792541504,
+ "mean_token_accuracy": 0.819708751142025,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.6412022431914726,
+ "eval_loss": 0.7036139965057373,
+ "eval_mean_token_accuracy": 0.8070317135098275,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 89.4733,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.989,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6581619590520859,
+ "epoch": 2.700060350030175,
+ "grad_norm": 1.00307035446167,
+ "learning_rate": 0.00033367389569042064,
+ "loss": 0.6397720336914062,
+ "mean_token_accuracy": 0.81413309648633,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6288736402318719,
+ "eval_loss": 0.6966825723648071,
+ "eval_mean_token_accuracy": 0.8094039669867312,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 88.7341,
+ "eval_samples_per_second": 16.003,
+ "eval_steps_per_second": 2.006,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6399412982165813,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.8589329719543457,
+ "learning_rate": 0.0003319403065539384,
+ "loss": 0.6347338199615479,
+ "mean_token_accuracy": 0.8139534957706929,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.683491913455256,
+ "eval_loss": 0.6984149217605591,
+ "eval_mean_token_accuracy": 0.8083989469522841,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 89.3929,
+ "eval_samples_per_second": 15.885,
+ "eval_steps_per_second": 1.991,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6264835461974144,
+ "epoch": 2.796620398310199,
+ "grad_norm": 0.7807853817939758,
+ "learning_rate": 0.0003301643882794163,
+ "loss": 0.6162629127502441,
+ "mean_token_accuracy": 0.8216292977333068,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6578792159476977,
+ "eval_loss": 0.6921441555023193,
+ "eval_mean_token_accuracy": 0.8094299177775223,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 89.2356,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.995,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6269129011780024,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 1.1675593852996826,
+ "learning_rate": 0.0003283466434307189,
+ "loss": 0.6235532760620117,
+ "mean_token_accuracy": 0.8188897788524627,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6533248447970058,
+ "eval_loss": 0.696849524974823,
+ "eval_mean_token_accuracy": 0.8102703713968898,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2602,
+ "eval_samples_per_second": 16.089,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.6259873781353236,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.9596486687660217,
+ "learning_rate": 0.00032648758640813655,
+ "loss": 0.6118728160858155,
+ "mean_token_accuracy": 0.8171859130263328,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6212078754821521,
+ "eval_loss": 0.6942870020866394,
+ "eval_mean_token_accuracy": 0.810484343365337,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 89.4375,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.99,
+ "step": 1200
+ },
+ {
+ "entropy": 0.6142537571489811,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 0.9625058770179749,
+ "learning_rate": 0.00032458774330281615,
+ "loss": 0.6060261249542236,
+ "mean_token_accuracy": 0.8223113484680653,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6553665667437436,
+ "eval_loss": 0.6835269331932068,
+ "eval_mean_token_accuracy": 0.8134723968720168,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 89.5092,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.989,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6301972426474094,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.9657333493232727,
+ "learning_rate": 0.0003226476517478835,
+ "loss": 0.6277759075164795,
+ "mean_token_accuracy": 0.8164266042411328,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6594253118788258,
+ "eval_loss": 0.6820935606956482,
+ "eval_mean_token_accuracy": 0.8132368198941263,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 89.6211,
+ "eval_samples_per_second": 15.844,
+ "eval_steps_per_second": 1.986,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5346100655469027,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8541185259819031,
+ "learning_rate": 0.0003206678607662996,
+ "loss": 0.5261692047119141,
+ "mean_token_accuracy": 0.8382289425119177,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5626645662476507,
+ "eval_loss": 0.7028542160987854,
+ "eval_mean_token_accuracy": 0.8133395572056931,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 89.1267,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.997,
+ "step": 1260
+ },
+ {
+ "entropy": 0.5001101832836866,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.8208815455436707,
+ "learning_rate": 0.0003186489306154935,
+ "loss": 0.4850132942199707,
+ "mean_token_accuracy": 0.8468983843922615,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5889462046743779,
+ "eval_loss": 0.691015899181366,
+ "eval_mean_token_accuracy": 0.8135226466012805,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.9677,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 2.001,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5242766339331866,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 0.7893072962760925,
+ "learning_rate": 0.0003165914326288163,
+ "loss": 0.5061577320098877,
+ "mean_token_accuracy": 0.8425608821213245,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5543691962957382,
+ "eval_loss": 0.6913734078407288,
+ "eval_mean_token_accuracy": 0.8154889680026622,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 89.6963,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.984,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5327721010893584,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.8992080092430115,
+ "learning_rate": 0.0003144959490538604,
+ "loss": 0.5068036556243897,
+ "mean_token_accuracy": 0.8420542575418949,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5734540803378887,
+ "eval_loss": 0.6948716044425964,
+ "eval_mean_token_accuracy": 0.8137217944257715,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 89.4597,
+ "eval_samples_per_second": 15.873,
+ "eval_steps_per_second": 1.99,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5247377116233111,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.9291845560073853,
+ "learning_rate": 0.0003123630728876902,
+ "loss": 0.5023272037506104,
+ "mean_token_accuracy": 0.8435182586312294,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5492362935891312,
+ "eval_loss": 0.6980633735656738,
+ "eval_mean_token_accuracy": 0.8155082919624415,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 89.2124,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.995,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5380499072372913,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 1.0477524995803833,
+ "learning_rate": 0.00031019340770903136,
+ "loss": 0.5264591693878173,
+ "mean_token_accuracy": 0.8391959741711617,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5896503307511297,
+ "eval_loss": 0.6997144222259521,
+ "eval_mean_token_accuracy": 0.8124373062942805,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 89.1147,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.997,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5460653610527515,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 1.2473069429397583,
+ "learning_rate": 0.00030798756750746476,
+ "loss": 0.5319677829742432,
+ "mean_token_accuracy": 0.8364320226013661,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5659052182114526,
+ "eval_loss": 0.6924049258232117,
+ "eval_mean_token_accuracy": 0.8153053585732921,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 89.6468,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.986,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5367407951503992,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 1.2679712772369385,
+ "learning_rate": 0.00030574617650967485,
+ "loss": 0.5190927028656006,
+ "mean_token_accuracy": 0.8399469174444676,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5581759144081159,
+ "eval_loss": 0.6933317184448242,
+ "eval_mean_token_accuracy": 0.8139757862251796,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 89.0749,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.998,
+ "step": 1400
+ },
+ {
+ "entropy": 0.530736118927598,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.9717612862586975,
+ "learning_rate": 0.0003034698690028009,
+ "loss": 0.512363052368164,
+ "mean_token_accuracy": 0.8419127956032753,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5233335836549823,
+ "eval_loss": 0.6958550214767456,
+ "eval_mean_token_accuracy": 0.8158778501360604,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 88.8664,
+ "eval_samples_per_second": 15.979,
+ "eval_steps_per_second": 2.003,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5327631575986743,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7649208903312683,
+ "learning_rate": 0.00030115928915494116,
+ "loss": 0.5202179431915284,
+ "mean_token_accuracy": 0.8384683802723885,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.5960972657364406,
+ "eval_loss": 0.6984783411026001,
+ "eval_mean_token_accuracy": 0.8095930597085631,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 89.5168,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5428155034780502,
+ "epoch": 3.51901025950513,
+ "grad_norm": 1.2790874242782593,
+ "learning_rate": 0.00029881509083286116,
+ "loss": 0.524717378616333,
+ "mean_token_accuracy": 0.8346644505858422,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.550318562917495,
+ "eval_loss": 0.6988471746444702,
+ "eval_mean_token_accuracy": 0.8132969897784544,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 89.2598,
+ "eval_samples_per_second": 15.909,
+ "eval_steps_per_second": 1.994,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5489993002265692,
+ "epoch": 3.567290283645142,
+ "grad_norm": 1.055821418762207,
+ "learning_rate": 0.00029643793741695687,
+ "loss": 0.5421150207519532,
+ "mean_token_accuracy": 0.8345710933208466,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5816821718818685,
+ "eval_loss": 0.6853668689727783,
+ "eval_mean_token_accuracy": 0.8142332360985574,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 89.0424,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.999,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5451365381479263,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.9027532935142517,
+ "learning_rate": 0.00029402850161352583,
+ "loss": 0.5463609218597412,
+ "mean_token_accuracy": 0.8369908526539802,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5344233209832331,
+ "eval_loss": 0.6794531345367432,
+ "eval_mean_token_accuracy": 0.8177759824843889,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 89.123,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.997,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5521467242389917,
+ "epoch": 3.663850331925166,
+ "grad_norm": 1.4606311321258545,
+ "learning_rate": 0.0002915874652643997,
+ "loss": 0.5421902179718018,
+ "mean_token_accuracy": 0.8339455373585224,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5807709094513668,
+ "eval_loss": 0.6949691772460938,
+ "eval_mean_token_accuracy": 0.8121141439743256,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.5437,
+ "eval_samples_per_second": 16.037,
+ "eval_steps_per_second": 2.01,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5455610822886229,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7269843220710754,
+ "learning_rate": 0.0002891155191539905,
+ "loss": 0.5407682895660401,
+ "mean_token_accuracy": 0.8393648222088814,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.6032205542151847,
+ "eval_loss": 0.6790974140167236,
+ "eval_mean_token_accuracy": 0.8165463112043531,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 89.517,
+ "eval_samples_per_second": 15.863,
+ "eval_steps_per_second": 1.988,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5474163968116045,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.8148866295814514,
+ "learning_rate": 0.00028661336281380717,
+ "loss": 0.5394441604614257,
+ "mean_token_accuracy": 0.8336028568446636,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5797032238392348,
+ "eval_loss": 0.670870304107666,
+ "eval_mean_token_accuracy": 0.8182691593518417,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 89.4468,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.99,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5511750865727663,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.3441656827926636,
+ "learning_rate": 0.0002840817043244964,
+ "loss": 0.5378933906555176,
+ "mean_token_accuracy": 0.8349151819944381,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5297858750217417,
+ "eval_loss": 0.680833637714386,
+ "eval_mean_token_accuracy": 0.8180924275617921,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 89.5417,
+ "eval_samples_per_second": 15.859,
+ "eval_steps_per_second": 1.988,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5379613988101483,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9813932776451111,
+ "learning_rate": 0.00028152126011546396,
+ "loss": 0.5340342044830322,
+ "mean_token_accuracy": 0.8346010789275169,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5811898510777549,
+ "eval_loss": 0.6764267683029175,
+ "eval_mean_token_accuracy": 0.8180528236239144,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 88.7831,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.005,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5607876226305961,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.9617928266525269,
+ "learning_rate": 0.00027893275476213383,
+ "loss": 0.5434338569641113,
+ "mean_token_accuracy": 0.8332898400723934,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5474644318390428,
+ "eval_loss": 0.6740226745605469,
+ "eval_mean_token_accuracy": 0.8185851306058047,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 89.3246,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5354843523353339,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.5320990085601807,
+ "learning_rate": 0.0002763169207809021,
+ "loss": 0.5251852989196777,
+ "mean_token_accuracy": 0.8416872084140777,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.5436856410141742,
+ "eval_loss": 0.6675190925598145,
+ "eval_mean_token_accuracy": 0.8202396507343549,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 89.6328,
+ "eval_samples_per_second": 15.842,
+ "eval_steps_per_second": 1.986,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5418571938167919,
+ "epoch": 4.0,
+ "grad_norm": 4.690354347229004,
+ "learning_rate": 0.000273674498421843,
+ "loss": 0.548275089263916,
+ "mean_token_accuracy": 0.836557479647847,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5497228983747825,
+ "eval_loss": 0.6621812582015991,
+ "eval_mean_token_accuracy": 0.8205679802412398,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 89.6272,
+ "eval_samples_per_second": 15.843,
+ "eval_steps_per_second": 1.986,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4195931971073151,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6678048968315125,
+ "learning_rate": 0.0002710062354592273,
+ "loss": 0.3970795154571533,
+ "mean_token_accuracy": 0.8719995342195034,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.46495268753405367,
+ "eval_loss": 0.7061581611633301,
+ "eval_mean_token_accuracy": 0.8190107995204712,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 89.6387,
+ "eval_samples_per_second": 15.841,
+ "eval_steps_per_second": 1.986,
+ "step": 1680
+ },
+ {
+ "entropy": 0.4263830740004778,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.7026669383049011,
+ "learning_rate": 0.000268312886979911,
+ "loss": 0.398905086517334,
+ "mean_token_accuracy": 0.8691012300550938,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.45755320670229666,
+ "eval_loss": 0.7102291584014893,
+ "eval_mean_token_accuracy": 0.819212955370378,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 89.2777,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.994,
+ "step": 1700
+ },
+ {
+ "entropy": 0.41640330031514167,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.752216100692749,
+ "learning_rate": 0.00026559521516965437,
+ "loss": 0.39748263359069824,
+ "mean_token_accuracy": 0.8684553548693656,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.469178682297803,
+ "eval_loss": 0.7004125714302063,
+ "eval_mean_token_accuracy": 0.8194386949030201,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 89.8428,
+ "eval_samples_per_second": 15.805,
+ "eval_steps_per_second": 1.981,
+ "step": 1720
+ },
+ {
+ "entropy": 0.42079071439802646,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.8349477648735046,
+ "learning_rate": 0.0002628539890974329,
+ "loss": 0.40129623413085935,
+ "mean_token_accuracy": 0.8686790131032467,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48358210871058904,
+ "eval_loss": 0.70196533203125,
+ "eval_mean_token_accuracy": 0.818096743875675,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 90.444,
+ "eval_samples_per_second": 15.7,
+ "eval_steps_per_second": 1.968,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4285690750926733,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.781974732875824,
+ "learning_rate": 0.00026008998449779933,
+ "loss": 0.40457854270935056,
+ "mean_token_accuracy": 0.8679066866636276,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.4653420230645812,
+ "eval_loss": 0.7041526436805725,
+ "eval_mean_token_accuracy": 0.8190121017815022,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 89.5248,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.988,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4335357129573822,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.8383703827857971,
+ "learning_rate": 0.0002573039835513604,
+ "loss": 0.41876921653747556,
+ "mean_token_accuracy": 0.8663770146667957,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.5015502416350869,
+ "eval_loss": 0.6904259324073792,
+ "eval_mean_token_accuracy": 0.8200626497188311,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 89.7014,
+ "eval_samples_per_second": 15.83,
+ "eval_steps_per_second": 1.984,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4258002445101738,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.7313240766525269,
+ "learning_rate": 0.00025449677466342867,
+ "loss": 0.40549774169921876,
+ "mean_token_accuracy": 0.8665009342133999,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.49225394293833313,
+ "eval_loss": 0.6914838552474976,
+ "eval_mean_token_accuracy": 0.8200667657878962,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 91.6837,
+ "eval_samples_per_second": 15.488,
+ "eval_steps_per_second": 1.941,
+ "step": 1800
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.8035854016335258e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d5c23212dd31aedbbc7ce0ace97f36c8bf2c5fc0
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json
@@ -0,0 +1,2113 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.772480386240193,
+ "eval_steps": 20,
+ "global_step": 1980,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.9366227277457203e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..eab9ea30e4820a6d866de21279b332866b819921
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json
@@ -0,0 +1,55 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.04828002414001207,
+ "eval_steps": 20,
+ "global_step": 20,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1980622700961792.0,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e7faecad0e5485d520712f4c86398d7523e2de06
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json
@@ -0,0 +1,244 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.4828002414001207,
+ "eval_steps": 20,
+ "global_step": 200,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.002938588074803e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e06986da34f4cc6d65c9433694a91294c02506eb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json
@@ -0,0 +1,2134 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.820760410380205,
+ "eval_steps": 20,
+ "global_step": 2000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.956564043065692e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..bdead565fe99ea51bad173a428f597c421f16a98
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json
@@ -0,0 +1,2155 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.869040434520217,
+ "eval_steps": 20,
+ "global_step": 2020,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.9775676437352653e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..18b70d75d7f9bdc19ef082b899bc65a900ed4d30
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json
@@ -0,0 +1,2176 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.917320458660229,
+ "eval_steps": 20,
+ "global_step": 2040,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.996087023009239e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ae0000c47a490271cc79a5c820e49d114a36d2f4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json
@@ -0,0 +1,2197 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.965600482800241,
+ "eval_steps": 20,
+ "global_step": 2060,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.0141362247874355e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b7f001f4ad835f76a021df2902e492496dbef859
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json
@@ -0,0 +1,2218 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.012070006035003,
+ "eval_steps": 20,
+ "global_step": 2080,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.034164382592635e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..23122add48828c62f5dfd1b8913cc0ef3376325d
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json
@@ -0,0 +1,2239 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.060350030175015,
+ "eval_steps": 20,
+ "global_step": 2100,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.0530469213502874e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ba4b833ba7fad512f560f4e4c617f59c00606992
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json
@@ -0,0 +1,2260 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.108630054315027,
+ "eval_steps": 20,
+ "global_step": 2120,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.0717110380996403e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..7c1a61156389705a460f54812d7f7df87005f47a
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json
@@ -0,0 +1,2281 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.15691007845504,
+ "eval_steps": 20,
+ "global_step": 2140,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ },
+ {
+ "entropy": 0.3008375624194741,
+ "epoch": 5.15691007845504,
+ "grad_norm": 0.797623336315155,
+ "learning_rate": 0.00021079737571505472,
+ "loss": 0.24592554569244385,
+ "mean_token_accuracy": 0.9159514293074608,
+ "num_tokens": 4950795.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.15691007845504,
+ "eval_entropy": 0.4180516125111098,
+ "eval_loss": 0.7242252826690674,
+ "eval_mean_token_accuracy": 0.8247456322895007,
+ "eval_num_tokens": 4950795.0,
+ "eval_runtime": 87.832,
+ "eval_samples_per_second": 16.167,
+ "eval_steps_per_second": 2.027,
+ "step": 2140
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.090833051589284e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b54988c810517ebf71a916cd105e89338d8523b3
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json
@@ -0,0 +1,2302 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.2051901025950515,
+ "eval_steps": 20,
+ "global_step": 2160,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ },
+ {
+ "entropy": 0.3008375624194741,
+ "epoch": 5.15691007845504,
+ "grad_norm": 0.797623336315155,
+ "learning_rate": 0.00021079737571505472,
+ "loss": 0.24592554569244385,
+ "mean_token_accuracy": 0.9159514293074608,
+ "num_tokens": 4950795.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.15691007845504,
+ "eval_entropy": 0.4180516125111098,
+ "eval_loss": 0.7242252826690674,
+ "eval_mean_token_accuracy": 0.8247456322895007,
+ "eval_num_tokens": 4950795.0,
+ "eval_runtime": 87.832,
+ "eval_samples_per_second": 16.167,
+ "eval_steps_per_second": 2.027,
+ "step": 2140
+ },
+ {
+ "entropy": 0.32739414311945436,
+ "epoch": 5.2051901025950515,
+ "grad_norm": 0.6331654191017151,
+ "learning_rate": 0.00020765231329410443,
+ "loss": 0.2587909460067749,
+ "mean_token_accuracy": 0.9127019934356213,
+ "num_tokens": 4994886.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.2051901025950515,
+ "eval_entropy": 0.43612574191575637,
+ "eval_loss": 0.7163131833076477,
+ "eval_mean_token_accuracy": 0.8249044545580831,
+ "eval_num_tokens": 4994886.0,
+ "eval_runtime": 88.184,
+ "eval_samples_per_second": 16.103,
+ "eval_steps_per_second": 2.019,
+ "step": 2160
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.1095296246209946e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..35c335e5ed20742fda69ad42952b2144c78acbca
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json
@@ -0,0 +1,2323 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.253470126735063,
+ "eval_steps": 20,
+ "global_step": 2180,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ },
+ {
+ "entropy": 0.3008375624194741,
+ "epoch": 5.15691007845504,
+ "grad_norm": 0.797623336315155,
+ "learning_rate": 0.00021079737571505472,
+ "loss": 0.24592554569244385,
+ "mean_token_accuracy": 0.9159514293074608,
+ "num_tokens": 4950795.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.15691007845504,
+ "eval_entropy": 0.4180516125111098,
+ "eval_loss": 0.7242252826690674,
+ "eval_mean_token_accuracy": 0.8247456322895007,
+ "eval_num_tokens": 4950795.0,
+ "eval_runtime": 87.832,
+ "eval_samples_per_second": 16.167,
+ "eval_steps_per_second": 2.027,
+ "step": 2140
+ },
+ {
+ "entropy": 0.32739414311945436,
+ "epoch": 5.2051901025950515,
+ "grad_norm": 0.6331654191017151,
+ "learning_rate": 0.00020765231329410443,
+ "loss": 0.2587909460067749,
+ "mean_token_accuracy": 0.9127019934356213,
+ "num_tokens": 4994886.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.2051901025950515,
+ "eval_entropy": 0.43612574191575637,
+ "eval_loss": 0.7163131833076477,
+ "eval_mean_token_accuracy": 0.8249044545580831,
+ "eval_num_tokens": 4994886.0,
+ "eval_runtime": 88.184,
+ "eval_samples_per_second": 16.103,
+ "eval_steps_per_second": 2.019,
+ "step": 2160
+ },
+ {
+ "entropy": 0.31282360590994357,
+ "epoch": 5.253470126735063,
+ "grad_norm": 0.8501704931259155,
+ "learning_rate": 0.00020450173007235538,
+ "loss": 0.2543140649795532,
+ "mean_token_accuracy": 0.9109282083809376,
+ "num_tokens": 5043663.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.253470126735063,
+ "eval_entropy": 0.42737145202883176,
+ "eval_loss": 0.715088963508606,
+ "eval_mean_token_accuracy": 0.8260066037097674,
+ "eval_num_tokens": 5043663.0,
+ "eval_runtime": 88.1598,
+ "eval_samples_per_second": 16.107,
+ "eval_steps_per_second": 2.019,
+ "step": 2180
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.129812169504133e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ec51bf7ad065cdf131531cea62b9ceb5714d3d87
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json
@@ -0,0 +1,265 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.5310802655401328,
+ "eval_steps": 20,
+ "global_step": 220,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.18071129571328e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5c3fdd27c8a15e3c4297cf6c17c1eaa51c624b4e
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json
@@ -0,0 +1,2344 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.301750150875075,
+ "eval_steps": 20,
+ "global_step": 2200,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ },
+ {
+ "entropy": 0.3008375624194741,
+ "epoch": 5.15691007845504,
+ "grad_norm": 0.797623336315155,
+ "learning_rate": 0.00021079737571505472,
+ "loss": 0.24592554569244385,
+ "mean_token_accuracy": 0.9159514293074608,
+ "num_tokens": 4950795.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.15691007845504,
+ "eval_entropy": 0.4180516125111098,
+ "eval_loss": 0.7242252826690674,
+ "eval_mean_token_accuracy": 0.8247456322895007,
+ "eval_num_tokens": 4950795.0,
+ "eval_runtime": 87.832,
+ "eval_samples_per_second": 16.167,
+ "eval_steps_per_second": 2.027,
+ "step": 2140
+ },
+ {
+ "entropy": 0.32739414311945436,
+ "epoch": 5.2051901025950515,
+ "grad_norm": 0.6331654191017151,
+ "learning_rate": 0.00020765231329410443,
+ "loss": 0.2587909460067749,
+ "mean_token_accuracy": 0.9127019934356213,
+ "num_tokens": 4994886.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.2051901025950515,
+ "eval_entropy": 0.43612574191575637,
+ "eval_loss": 0.7163131833076477,
+ "eval_mean_token_accuracy": 0.8249044545580831,
+ "eval_num_tokens": 4994886.0,
+ "eval_runtime": 88.184,
+ "eval_samples_per_second": 16.103,
+ "eval_steps_per_second": 2.019,
+ "step": 2160
+ },
+ {
+ "entropy": 0.31282360590994357,
+ "epoch": 5.253470126735063,
+ "grad_norm": 0.8501704931259155,
+ "learning_rate": 0.00020450173007235538,
+ "loss": 0.2543140649795532,
+ "mean_token_accuracy": 0.9109282083809376,
+ "num_tokens": 5043663.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.253470126735063,
+ "eval_entropy": 0.42737145202883176,
+ "eval_loss": 0.715088963508606,
+ "eval_mean_token_accuracy": 0.8260066037097674,
+ "eval_num_tokens": 5043663.0,
+ "eval_runtime": 88.1598,
+ "eval_samples_per_second": 16.107,
+ "eval_steps_per_second": 2.019,
+ "step": 2180
+ },
+ {
+ "entropy": 0.31767325326800344,
+ "epoch": 5.301750150875075,
+ "grad_norm": 0.808242917060852,
+ "learning_rate": 0.0002013465176275914,
+ "loss": 0.25598506927490233,
+ "mean_token_accuracy": 0.9112607099115848,
+ "num_tokens": 5087959.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.301750150875075,
+ "eval_entropy": 0.420320589723212,
+ "eval_loss": 0.7172654867172241,
+ "eval_mean_token_accuracy": 0.8260447238938192,
+ "eval_num_tokens": 5087959.0,
+ "eval_runtime": 88.1646,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 2200
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.148549093589586e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..bede130010a92c3e190957528ee99ee9d7d8ccd4
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json
@@ -0,0 +1,2365 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.350030175015087,
+ "eval_steps": 20,
+ "global_step": 2220,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 2.172999547421932,
+ "epoch": 0.04828002414001207,
+ "grad_norm": 2.5071208477020264,
+ "learning_rate": 1.7227585487708594e-05,
+ "loss": 1.9347333908081055,
+ "mean_token_accuracy": 0.6086816020309925,
+ "num_tokens": 47778.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.04828002414001207,
+ "eval_entropy": 1.6909754791956269,
+ "eval_loss": 1.4728385210037231,
+ "eval_mean_token_accuracy": 0.6773593797442619,
+ "eval_num_tokens": 47778.0,
+ "eval_runtime": 90.1265,
+ "eval_samples_per_second": 15.756,
+ "eval_steps_per_second": 1.975,
+ "step": 20
+ },
+ {
+ "entropy": 1.2014626950025558,
+ "epoch": 0.09656004828002414,
+ "grad_norm": 1.5074543952941895,
+ "learning_rate": 3.5361886001086065e-05,
+ "loss": 1.0867146492004394,
+ "mean_token_accuracy": 0.7285927519202232,
+ "num_tokens": 95981.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.09656004828002414,
+ "eval_entropy": 1.0304168352250302,
+ "eval_loss": 0.9211422204971313,
+ "eval_mean_token_accuracy": 0.7613122848312507,
+ "eval_num_tokens": 95981.0,
+ "eval_runtime": 88.6338,
+ "eval_samples_per_second": 16.021,
+ "eval_steps_per_second": 2.008,
+ "step": 40
+ },
+ {
+ "entropy": 0.9454198732972146,
+ "epoch": 0.14484007242003621,
+ "grad_norm": 1.7578108310699463,
+ "learning_rate": 5.349618651446354e-05,
+ "loss": 0.8447297096252442,
+ "mean_token_accuracy": 0.7723424732685089,
+ "num_tokens": 142784.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.14484007242003621,
+ "eval_entropy": 0.8647834474451086,
+ "eval_loss": 0.8240737318992615,
+ "eval_mean_token_accuracy": 0.7821227014064789,
+ "eval_num_tokens": 142784.0,
+ "eval_runtime": 88.0135,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 60
+ },
+ {
+ "entropy": 0.8963550612330436,
+ "epoch": 0.19312009656004828,
+ "grad_norm": 1.1464931964874268,
+ "learning_rate": 7.1630487027841e-05,
+ "loss": 0.7979836463928223,
+ "mean_token_accuracy": 0.7822489373385906,
+ "num_tokens": 187338.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.19312009656004828,
+ "eval_entropy": 0.8663296133614657,
+ "eval_loss": 0.7752988338470459,
+ "eval_mean_token_accuracy": 0.7885957012015782,
+ "eval_num_tokens": 187338.0,
+ "eval_runtime": 88.284,
+ "eval_samples_per_second": 16.084,
+ "eval_steps_per_second": 2.016,
+ "step": 80
+ },
+ {
+ "entropy": 0.8265103206038475,
+ "epoch": 0.24140012070006034,
+ "grad_norm": 1.0106662511825562,
+ "learning_rate": 8.976478754121848e-05,
+ "loss": 0.7297060012817382,
+ "mean_token_accuracy": 0.7955138415098191,
+ "num_tokens": 236038.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24140012070006034,
+ "eval_entropy": 0.8122169536151244,
+ "eval_loss": 0.754906177520752,
+ "eval_mean_token_accuracy": 0.7917155255092664,
+ "eval_num_tokens": 236038.0,
+ "eval_runtime": 87.5754,
+ "eval_samples_per_second": 16.215,
+ "eval_steps_per_second": 2.033,
+ "step": 100
+ },
+ {
+ "entropy": 0.8098392844200134,
+ "epoch": 0.28968014484007243,
+ "grad_norm": 1.2238041162490845,
+ "learning_rate": 0.00010789908805459595,
+ "loss": 0.7201489448547364,
+ "mean_token_accuracy": 0.7975016921758652,
+ "num_tokens": 282918.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.28968014484007243,
+ "eval_entropy": 0.8418726462326692,
+ "eval_loss": 0.7393178939819336,
+ "eval_mean_token_accuracy": 0.7936771585700217,
+ "eval_num_tokens": 282918.0,
+ "eval_runtime": 87.1597,
+ "eval_samples_per_second": 16.292,
+ "eval_steps_per_second": 2.042,
+ "step": 120
+ },
+ {
+ "entropy": 0.8080591082572937,
+ "epoch": 0.33796016898008446,
+ "grad_norm": 1.011591911315918,
+ "learning_rate": 0.00012603338856797343,
+ "loss": 0.7147697925567627,
+ "mean_token_accuracy": 0.7947175532579422,
+ "num_tokens": 331305.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.33796016898008446,
+ "eval_entropy": 0.7894941431083037,
+ "eval_loss": 0.720219075679779,
+ "eval_mean_token_accuracy": 0.801899236239744,
+ "eval_num_tokens": 331305.0,
+ "eval_runtime": 87.1493,
+ "eval_samples_per_second": 16.294,
+ "eval_steps_per_second": 2.042,
+ "step": 140
+ },
+ {
+ "entropy": 0.7957205109298229,
+ "epoch": 0.38624019312009655,
+ "grad_norm": 0.8481830954551697,
+ "learning_rate": 0.00014416768908135088,
+ "loss": 0.7050027847290039,
+ "mean_token_accuracy": 0.7995368830859662,
+ "num_tokens": 375876.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.38624019312009655,
+ "eval_entropy": 0.7746140591883928,
+ "eval_loss": 0.7175475358963013,
+ "eval_mean_token_accuracy": 0.7994848955213354,
+ "eval_num_tokens": 375876.0,
+ "eval_runtime": 86.655,
+ "eval_samples_per_second": 16.387,
+ "eval_steps_per_second": 2.054,
+ "step": 160
+ },
+ {
+ "entropy": 0.779565304517746,
+ "epoch": 0.43452021726010864,
+ "grad_norm": 1.032624363899231,
+ "learning_rate": 0.00016230198959472835,
+ "loss": 0.6978332042694092,
+ "mean_token_accuracy": 0.8015618294477462,
+ "num_tokens": 423913.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.43452021726010864,
+ "eval_entropy": 0.7455583871080634,
+ "eval_loss": 0.7118850350379944,
+ "eval_mean_token_accuracy": 0.7999682195400923,
+ "eval_num_tokens": 423913.0,
+ "eval_runtime": 86.7842,
+ "eval_samples_per_second": 16.362,
+ "eval_steps_per_second": 2.051,
+ "step": 180
+ },
+ {
+ "entropy": 0.7810172818601131,
+ "epoch": 0.4828002414001207,
+ "grad_norm": 0.9276663064956665,
+ "learning_rate": 0.00018043629010810582,
+ "loss": 0.6937861442565918,
+ "mean_token_accuracy": 0.802893053740263,
+ "num_tokens": 472395.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.4828002414001207,
+ "eval_entropy": 0.7650193290764027,
+ "eval_loss": 0.7020567059516907,
+ "eval_mean_token_accuracy": 0.8045302153973097,
+ "eval_num_tokens": 472395.0,
+ "eval_runtime": 88.326,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 200
+ },
+ {
+ "entropy": 0.7862060204148292,
+ "epoch": 0.5310802655401328,
+ "grad_norm": 0.8195295929908752,
+ "learning_rate": 0.0001985705906214833,
+ "loss": 0.6878782272338867,
+ "mean_token_accuracy": 0.8027168907225132,
+ "num_tokens": 517049.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.5310802655401328,
+ "eval_entropy": 0.7656565583154057,
+ "eval_loss": 0.6973932981491089,
+ "eval_mean_token_accuracy": 0.8047967278555538,
+ "eval_num_tokens": 517049.0,
+ "eval_runtime": 87.7698,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 220
+ },
+ {
+ "entropy": 0.7611534461379051,
+ "epoch": 0.5793602896801449,
+ "grad_norm": 0.7499712109565735,
+ "learning_rate": 0.00021670489113486077,
+ "loss": 0.681937837600708,
+ "mean_token_accuracy": 0.8041978515684605,
+ "num_tokens": 562836.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.5793602896801449,
+ "eval_entropy": 0.7599442380197933,
+ "eval_loss": 0.7002046704292297,
+ "eval_mean_token_accuracy": 0.8051861517884759,
+ "eval_num_tokens": 562836.0,
+ "eval_runtime": 87.9239,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 240
+ },
+ {
+ "entropy": 0.7800783462822437,
+ "epoch": 0.627640313820157,
+ "grad_norm": 0.8645269274711609,
+ "learning_rate": 0.00023483919164823825,
+ "loss": 0.6954500675201416,
+ "mean_token_accuracy": 0.8031484372913837,
+ "num_tokens": 606612.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.627640313820157,
+ "eval_entropy": 0.7498679090751691,
+ "eval_loss": 0.7046149373054504,
+ "eval_mean_token_accuracy": 0.802388215667746,
+ "eval_num_tokens": 606612.0,
+ "eval_runtime": 88.2468,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 260
+ },
+ {
+ "entropy": 0.7586533665657044,
+ "epoch": 0.6759203379601689,
+ "grad_norm": 0.741596519947052,
+ "learning_rate": 0.0002529734921616157,
+ "loss": 0.690476369857788,
+ "mean_token_accuracy": 0.8046923100948333,
+ "num_tokens": 655920.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6759203379601689,
+ "eval_entropy": 0.7714274066887544,
+ "eval_loss": 0.6992160677909851,
+ "eval_mean_token_accuracy": 0.8042646482419432,
+ "eval_num_tokens": 655920.0,
+ "eval_runtime": 88.1754,
+ "eval_samples_per_second": 16.104,
+ "eval_steps_per_second": 2.019,
+ "step": 280
+ },
+ {
+ "entropy": 0.7585848286747933,
+ "epoch": 0.724200362100181,
+ "grad_norm": 1.0778124332427979,
+ "learning_rate": 0.00027110779267499317,
+ "loss": 0.6790409564971924,
+ "mean_token_accuracy": 0.8060351841151714,
+ "num_tokens": 702638.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.724200362100181,
+ "eval_entropy": 0.7380402811457601,
+ "eval_loss": 0.7054820656776428,
+ "eval_mean_token_accuracy": 0.8003534738267406,
+ "eval_num_tokens": 702638.0,
+ "eval_runtime": 88.238,
+ "eval_samples_per_second": 16.093,
+ "eval_steps_per_second": 2.017,
+ "step": 300
+ },
+ {
+ "entropy": 0.7696981988847256,
+ "epoch": 0.7724803862401931,
+ "grad_norm": 0.8408658504486084,
+ "learning_rate": 0.00028924209318837064,
+ "loss": 0.7070387363433838,
+ "mean_token_accuracy": 0.8035947173833847,
+ "num_tokens": 749377.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.7724803862401931,
+ "eval_entropy": 0.7897409023193831,
+ "eval_loss": 0.7015668749809265,
+ "eval_mean_token_accuracy": 0.805306687113944,
+ "eval_num_tokens": 749377.0,
+ "eval_runtime": 87.9395,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 320
+ },
+ {
+ "entropy": 0.762337189912796,
+ "epoch": 0.8207604103802052,
+ "grad_norm": 0.9843310117721558,
+ "learning_rate": 0.0003073763937017481,
+ "loss": 0.7021088123321533,
+ "mean_token_accuracy": 0.8029616877436638,
+ "num_tokens": 798874.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8207604103802052,
+ "eval_entropy": 0.7210077121016685,
+ "eval_loss": 0.7082746624946594,
+ "eval_mean_token_accuracy": 0.8049283824609906,
+ "eval_num_tokens": 798874.0,
+ "eval_runtime": 88.1706,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 340
+ },
+ {
+ "entropy": 0.7879025422036647,
+ "epoch": 0.8690404345202173,
+ "grad_norm": 0.9713814854621887,
+ "learning_rate": 0.0003255106942151256,
+ "loss": 0.714624547958374,
+ "mean_token_accuracy": 0.79987031519413,
+ "num_tokens": 840825.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8690404345202173,
+ "eval_entropy": 0.7866930489459735,
+ "eval_loss": 0.7145519852638245,
+ "eval_mean_token_accuracy": 0.8015657988157165,
+ "eval_num_tokens": 840825.0,
+ "eval_runtime": 88.3746,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 360
+ },
+ {
+ "entropy": 0.7844726584851742,
+ "epoch": 0.9173204586602294,
+ "grad_norm": 1.2028311491012573,
+ "learning_rate": 0.00034364499472850306,
+ "loss": 0.7040786266326904,
+ "mean_token_accuracy": 0.7981885217130185,
+ "num_tokens": 882885.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9173204586602294,
+ "eval_entropy": 0.7767668339643585,
+ "eval_loss": 0.7073574066162109,
+ "eval_mean_token_accuracy": 0.8040851833445303,
+ "eval_num_tokens": 882885.0,
+ "eval_runtime": 88.3828,
+ "eval_samples_per_second": 16.066,
+ "eval_steps_per_second": 2.014,
+ "step": 380
+ },
+ {
+ "entropy": 0.7699790760874748,
+ "epoch": 0.9656004828002414,
+ "grad_norm": 0.9397398233413696,
+ "learning_rate": 0.00036177929524188054,
+ "loss": 0.7040313720703125,
+ "mean_token_accuracy": 0.8034727744758129,
+ "num_tokens": 927456.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9656004828002414,
+ "eval_entropy": 0.7749103545472863,
+ "eval_loss": 0.7093513011932373,
+ "eval_mean_token_accuracy": 0.8019482901926791,
+ "eval_num_tokens": 927456.0,
+ "eval_runtime": 86.2112,
+ "eval_samples_per_second": 16.471,
+ "eval_steps_per_second": 2.065,
+ "step": 400
+ },
+ {
+ "entropy": 0.7672389172888422,
+ "epoch": 1.012070006035003,
+ "grad_norm": 0.99210524559021,
+ "learning_rate": 0.00037628567078152296,
+ "loss": 0.6913118362426758,
+ "mean_token_accuracy": 0.8042210944287189,
+ "num_tokens": 972662.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.012070006035003,
+ "eval_entropy": 0.7294771229283193,
+ "eval_loss": 0.7171520590782166,
+ "eval_mean_token_accuracy": 0.8015128585059991,
+ "eval_num_tokens": 972662.0,
+ "eval_runtime": 88.037,
+ "eval_samples_per_second": 16.13,
+ "eval_steps_per_second": 2.022,
+ "step": 420
+ },
+ {
+ "entropy": 0.7143943183124065,
+ "epoch": 1.060350030175015,
+ "grad_norm": 1.087638258934021,
+ "learning_rate": 0.0003762484015601069,
+ "loss": 0.642704439163208,
+ "mean_token_accuracy": 0.8124966286122799,
+ "num_tokens": 1022525.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.060350030175015,
+ "eval_entropy": 0.743511886744017,
+ "eval_loss": 0.7116662859916687,
+ "eval_mean_token_accuracy": 0.8037210672758939,
+ "eval_num_tokens": 1022525.0,
+ "eval_runtime": 87.9931,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 440
+ },
+ {
+ "entropy": 0.7237346574664116,
+ "epoch": 1.1086300543150271,
+ "grad_norm": 0.9365553259849548,
+ "learning_rate": 0.0003761579008392123,
+ "loss": 0.652644681930542,
+ "mean_token_accuracy": 0.8107496216893196,
+ "num_tokens": 1069194.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1086300543150271,
+ "eval_entropy": 0.7372823839776972,
+ "eval_loss": 0.7238303422927856,
+ "eval_mean_token_accuracy": 0.8026230124275336,
+ "eval_num_tokens": 1069194.0,
+ "eval_runtime": 87.6778,
+ "eval_samples_per_second": 16.196,
+ "eval_steps_per_second": 2.03,
+ "step": 460
+ },
+ {
+ "entropy": 0.7202137842774391,
+ "epoch": 1.1569100784550392,
+ "grad_norm": 0.7998443841934204,
+ "learning_rate": 0.0003760141942294726,
+ "loss": 0.6485219478607178,
+ "mean_token_accuracy": 0.8092714451253414,
+ "num_tokens": 1117570.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1569100784550392,
+ "eval_entropy": 0.71547647942318,
+ "eval_loss": 0.7124277949333191,
+ "eval_mean_token_accuracy": 0.8013174219077892,
+ "eval_num_tokens": 1117570.0,
+ "eval_runtime": 87.4387,
+ "eval_samples_per_second": 16.24,
+ "eval_steps_per_second": 2.036,
+ "step": 480
+ },
+ {
+ "entropy": 0.7270819500088692,
+ "epoch": 1.2051901025950513,
+ "grad_norm": 0.9470787644386292,
+ "learning_rate": 0.00037581732239815854,
+ "loss": 0.66352219581604,
+ "mean_token_accuracy": 0.8102593503892421,
+ "num_tokens": 1161717.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.2051901025950513,
+ "eval_entropy": 0.7791565897759427,
+ "eval_loss": 0.7179726958274841,
+ "eval_mean_token_accuracy": 0.7948898328154275,
+ "eval_num_tokens": 1161717.0,
+ "eval_runtime": 87.9927,
+ "eval_samples_per_second": 16.138,
+ "eval_steps_per_second": 2.023,
+ "step": 500
+ },
+ {
+ "entropy": 0.7320936664938926,
+ "epoch": 1.2534701267350634,
+ "grad_norm": 1.0220379829406738,
+ "learning_rate": 0.0003755673410576695,
+ "loss": 0.6581549644470215,
+ "mean_token_accuracy": 0.8098709337413311,
+ "num_tokens": 1209390.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.2534701267350634,
+ "eval_entropy": 0.7710678225822662,
+ "eval_loss": 0.708797812461853,
+ "eval_mean_token_accuracy": 0.8039572778042783,
+ "eval_num_tokens": 1209390.0,
+ "eval_runtime": 88.1193,
+ "eval_samples_per_second": 16.115,
+ "eval_steps_per_second": 2.02,
+ "step": 520
+ },
+ {
+ "entropy": 0.7281674664467573,
+ "epoch": 1.3017501508750755,
+ "grad_norm": 0.8775188326835632,
+ "learning_rate": 0.000375264320949768,
+ "loss": 0.6631278991699219,
+ "mean_token_accuracy": 0.8101261422038079,
+ "num_tokens": 1256611.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3017501508750755,
+ "eval_entropy": 0.7199799800187014,
+ "eval_loss": 0.6981531381607056,
+ "eval_mean_token_accuracy": 0.8071265254127845,
+ "eval_num_tokens": 1256611.0,
+ "eval_runtime": 88.165,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 540
+ },
+ {
+ "entropy": 0.722860773652792,
+ "epoch": 1.3500301750150876,
+ "grad_norm": 0.8949288129806519,
+ "learning_rate": 0.00037490834782556,
+ "loss": 0.6639598846435547,
+ "mean_token_accuracy": 0.8105649061501026,
+ "num_tokens": 1302325.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3500301750150876,
+ "eval_entropy": 0.7134760032209118,
+ "eval_loss": 0.7029948234558105,
+ "eval_mean_token_accuracy": 0.8062985880991046,
+ "eval_num_tokens": 1302325.0,
+ "eval_runtime": 88.1286,
+ "eval_samples_per_second": 16.113,
+ "eval_steps_per_second": 2.02,
+ "step": 560
+ },
+ {
+ "entropy": 0.7299126699566841,
+ "epoch": 1.3983101991550995,
+ "grad_norm": 1.0323039293289185,
+ "learning_rate": 0.0003744995224212291,
+ "loss": 0.6535763263702392,
+ "mean_token_accuracy": 0.8120224848389626,
+ "num_tokens": 1343844.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.3983101991550995,
+ "eval_entropy": 0.7169701182440426,
+ "eval_loss": 0.7067857980728149,
+ "eval_mean_token_accuracy": 0.8040432936689826,
+ "eval_num_tokens": 1343844.0,
+ "eval_runtime": 88.2252,
+ "eval_samples_per_second": 16.095,
+ "eval_steps_per_second": 2.018,
+ "step": 580
+ },
+ {
+ "entropy": 0.7281742256134749,
+ "epoch": 1.4465902232951118,
+ "grad_norm": 1.3370424509048462,
+ "learning_rate": 0.00037403796042952863,
+ "loss": 0.6637272357940673,
+ "mean_token_accuracy": 0.8118261776864528,
+ "num_tokens": 1389471.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4465902232951118,
+ "eval_entropy": 0.7378843212395572,
+ "eval_loss": 0.7038390040397644,
+ "eval_mean_token_accuracy": 0.8059229371922739,
+ "eval_num_tokens": 1389471.0,
+ "eval_runtime": 87.9301,
+ "eval_samples_per_second": 16.149,
+ "eval_steps_per_second": 2.024,
+ "step": 600
+ },
+ {
+ "entropy": 0.7388614989817143,
+ "epoch": 1.4948702474351236,
+ "grad_norm": 0.8464171290397644,
+ "learning_rate": 0.00037352379246704257,
+ "loss": 0.6604740142822265,
+ "mean_token_accuracy": 0.8102974124252796,
+ "num_tokens": 1435975.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.4948702474351236,
+ "eval_entropy": 0.7126847046814607,
+ "eval_loss": 0.6950703263282776,
+ "eval_mean_token_accuracy": 0.8085885392815879,
+ "eval_num_tokens": 1435975.0,
+ "eval_runtime": 88.2732,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.016,
+ "step": 620
+ },
+ {
+ "entropy": 0.7258916139602661,
+ "epoch": 1.5431502715751357,
+ "grad_norm": 1.1780085563659668,
+ "learning_rate": 0.0003729571640372223,
+ "loss": 0.6529891014099121,
+ "mean_token_accuracy": 0.8085981778800487,
+ "num_tokens": 1482035.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.5431502715751357,
+ "eval_entropy": 0.7096509638797032,
+ "eval_loss": 0.690051257610321,
+ "eval_mean_token_accuracy": 0.8100520241796301,
+ "eval_num_tokens": 1482035.0,
+ "eval_runtime": 88.3153,
+ "eval_samples_per_second": 16.079,
+ "eval_steps_per_second": 2.016,
+ "step": 640
+ },
+ {
+ "entropy": 0.7151173129677773,
+ "epoch": 1.5914302957151478,
+ "grad_norm": 1.0357667207717896,
+ "learning_rate": 0.0003723382354892108,
+ "loss": 0.6451474189758301,
+ "mean_token_accuracy": 0.8136902332305909,
+ "num_tokens": 1528119.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.5914302957151478,
+ "eval_entropy": 0.7060252652409371,
+ "eval_loss": 0.6899483799934387,
+ "eval_mean_token_accuracy": 0.810834194502134,
+ "eval_num_tokens": 1528119.0,
+ "eval_runtime": 87.8848,
+ "eval_samples_per_second": 16.158,
+ "eval_steps_per_second": 2.025,
+ "step": 660
+ },
+ {
+ "entropy": 0.7141377851366997,
+ "epoch": 1.63971031985516,
+ "grad_norm": 0.8391667008399963,
+ "learning_rate": 0.000371667181972466,
+ "loss": 0.6481579780578614,
+ "mean_token_accuracy": 0.8159015104174614,
+ "num_tokens": 1573661.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.63971031985516,
+ "eval_entropy": 0.7598993319473909,
+ "eval_loss": 0.681204080581665,
+ "eval_mean_token_accuracy": 0.8100194586126992,
+ "eval_num_tokens": 1573661.0,
+ "eval_runtime": 88.2415,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 680
+ },
+ {
+ "entropy": 0.7235980287194252,
+ "epoch": 1.687990343995172,
+ "grad_norm": 0.8197196125984192,
+ "learning_rate": 0.00037094419338719537,
+ "loss": 0.6582849025726318,
+ "mean_token_accuracy": 0.8114834539592266,
+ "num_tokens": 1621714.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.687990343995172,
+ "eval_entropy": 0.7166854568411795,
+ "eval_loss": 0.679177463054657,
+ "eval_mean_token_accuracy": 0.8119039877077167,
+ "eval_num_tokens": 1621714.0,
+ "eval_runtime": 88.0957,
+ "eval_samples_per_second": 16.119,
+ "eval_steps_per_second": 2.021,
+ "step": 700
+ },
+ {
+ "entropy": 0.7278190158307553,
+ "epoch": 1.736270368135184,
+ "grad_norm": 0.7820602655410767,
+ "learning_rate": 0.0003701694743306164,
+ "loss": 0.6633153438568116,
+ "mean_token_accuracy": 0.8123249113559723,
+ "num_tokens": 1672118.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.736270368135184,
+ "eval_entropy": 0.6980850314826108,
+ "eval_loss": 0.6775653958320618,
+ "eval_mean_token_accuracy": 0.8116872906684875,
+ "eval_num_tokens": 1672118.0,
+ "eval_runtime": 87.9795,
+ "eval_samples_per_second": 16.14,
+ "eval_steps_per_second": 2.023,
+ "step": 720
+ },
+ {
+ "entropy": 0.7149631556123495,
+ "epoch": 1.7845503922751962,
+ "grad_norm": 1.0139760971069336,
+ "learning_rate": 0.00036934324403905795,
+ "loss": 0.6468976020812989,
+ "mean_token_accuracy": 0.8117561548948288,
+ "num_tokens": 1720465.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.7845503922751962,
+ "eval_entropy": 0.69009849094273,
+ "eval_loss": 0.6731093525886536,
+ "eval_mean_token_accuracy": 0.81281964196248,
+ "eval_num_tokens": 1720465.0,
+ "eval_runtime": 87.7412,
+ "eval_samples_per_second": 16.184,
+ "eval_steps_per_second": 2.029,
+ "step": 740
+ },
+ {
+ "entropy": 0.7226049453020096,
+ "epoch": 1.832830416415208,
+ "grad_norm": 1.5040546655654907,
+ "learning_rate": 0.0003684657363259193,
+ "loss": 0.6385328769683838,
+ "mean_token_accuracy": 0.8132639616727829,
+ "num_tokens": 1764440.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.832830416415208,
+ "eval_entropy": 0.7125169618076153,
+ "eval_loss": 0.6864680647850037,
+ "eval_mean_token_accuracy": 0.8049418089095126,
+ "eval_num_tokens": 1764440.0,
+ "eval_runtime": 87.9429,
+ "eval_samples_per_second": 16.147,
+ "eval_steps_per_second": 2.024,
+ "step": 760
+ },
+ {
+ "entropy": 0.707821810990572,
+ "epoch": 1.8811104405552204,
+ "grad_norm": 0.8604223132133484,
+ "learning_rate": 0.00036753719951550327,
+ "loss": 0.6397049427032471,
+ "mean_token_accuracy": 0.8137877315282822,
+ "num_tokens": 1810828.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.8811104405552204,
+ "eval_entropy": 0.6492102551326323,
+ "eval_loss": 0.6743726134300232,
+ "eval_mean_token_accuracy": 0.8130356572317273,
+ "eval_num_tokens": 1810828.0,
+ "eval_runtime": 87.8684,
+ "eval_samples_per_second": 16.161,
+ "eval_steps_per_second": 2.026,
+ "step": 780
+ },
+ {
+ "entropy": 0.6800355084240437,
+ "epoch": 1.9293904646952322,
+ "grad_norm": 0.7270982265472412,
+ "learning_rate": 0.00036655789637274377,
+ "loss": 0.6267755031585693,
+ "mean_token_accuracy": 0.8180945307016373,
+ "num_tokens": 1857600.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9293904646952322,
+ "eval_entropy": 0.6727538651294922,
+ "eval_loss": 0.6696028709411621,
+ "eval_mean_token_accuracy": 0.8116443090224534,
+ "eval_num_tokens": 1857600.0,
+ "eval_runtime": 88.2449,
+ "eval_samples_per_second": 16.092,
+ "eval_steps_per_second": 2.017,
+ "step": 800
+ },
+ {
+ "entropy": 0.6746691606938839,
+ "epoch": 1.9776704888352445,
+ "grad_norm": 0.9771540760993958,
+ "learning_rate": 0.0003655281040288461,
+ "loss": 0.6326992988586426,
+ "mean_token_accuracy": 0.8179976396262646,
+ "num_tokens": 1901998.0,
+ "step": 820
+ },
+ {
+ "epoch": 1.9776704888352445,
+ "eval_entropy": 0.6636319716324967,
+ "eval_loss": 0.6714363098144531,
+ "eval_mean_token_accuracy": 0.8126635943235976,
+ "eval_num_tokens": 1901998.0,
+ "eval_runtime": 87.7666,
+ "eval_samples_per_second": 16.179,
+ "eval_steps_per_second": 2.028,
+ "step": 820
+ },
+ {
+ "entropy": 0.6319125778489298,
+ "epoch": 2.024140012070006,
+ "grad_norm": 0.8380444645881653,
+ "learning_rate": 0.0003644481139028622,
+ "loss": 0.5780903816223144,
+ "mean_token_accuracy": 0.8250188401767186,
+ "num_tokens": 1947553.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.024140012070006,
+ "eval_entropy": 0.6627151989535,
+ "eval_loss": 0.6774935722351074,
+ "eval_mean_token_accuracy": 0.8140510819601209,
+ "eval_num_tokens": 1947553.0,
+ "eval_runtime": 87.8287,
+ "eval_samples_per_second": 16.168,
+ "eval_steps_per_second": 2.027,
+ "step": 840
+ },
+ {
+ "entropy": 0.6059147048741579,
+ "epoch": 2.0724200362100182,
+ "grad_norm": 0.9745152592658997,
+ "learning_rate": 0.0003633182316192229,
+ "loss": 0.546702527999878,
+ "mean_token_accuracy": 0.8358186542987823,
+ "num_tokens": 1995234.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.0724200362100182,
+ "eval_entropy": 0.6620710384979677,
+ "eval_loss": 0.6769291162490845,
+ "eval_mean_token_accuracy": 0.8135082835561773,
+ "eval_num_tokens": 1995234.0,
+ "eval_runtime": 88.0008,
+ "eval_samples_per_second": 16.136,
+ "eval_steps_per_second": 2.023,
+ "step": 860
+ },
+ {
+ "entropy": 0.6076117843389511,
+ "epoch": 2.12070006035003,
+ "grad_norm": 0.6914380192756653,
+ "learning_rate": 0.0003621387769212491,
+ "loss": 0.5324535846710206,
+ "mean_token_accuracy": 0.8366568259894848,
+ "num_tokens": 2040639.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.12070006035003,
+ "eval_entropy": 0.6592224213514435,
+ "eval_loss": 0.670383632183075,
+ "eval_mean_token_accuracy": 0.8162150088320957,
+ "eval_num_tokens": 2040639.0,
+ "eval_runtime": 88.324,
+ "eval_samples_per_second": 16.077,
+ "eval_steps_per_second": 2.015,
+ "step": 880
+ },
+ {
+ "entropy": 0.6158072650432587,
+ "epoch": 2.1689800844900424,
+ "grad_norm": 0.9649198055267334,
+ "learning_rate": 0.0003609100835806688,
+ "loss": 0.5564568996429443,
+ "mean_token_accuracy": 0.8329654954373836,
+ "num_tokens": 2090604.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.1689800844900424,
+ "eval_entropy": 0.608588819758276,
+ "eval_loss": 0.6745102405548096,
+ "eval_mean_token_accuracy": 0.8155080542135774,
+ "eval_num_tokens": 2090604.0,
+ "eval_runtime": 87.52,
+ "eval_samples_per_second": 16.225,
+ "eval_steps_per_second": 2.034,
+ "step": 900
+ },
+ {
+ "entropy": 0.5938734326511621,
+ "epoch": 2.2172601086300543,
+ "grad_norm": 0.6915557384490967,
+ "learning_rate": 0.0003596324993031632,
+ "loss": 0.5351875782012939,
+ "mean_token_accuracy": 0.8385631121695042,
+ "num_tokens": 2142246.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2172601086300543,
+ "eval_entropy": 0.6251631205001574,
+ "eval_loss": 0.6664518117904663,
+ "eval_mean_token_accuracy": 0.81711940417129,
+ "eval_num_tokens": 2142246.0,
+ "eval_runtime": 87.1792,
+ "eval_samples_per_second": 16.288,
+ "eval_steps_per_second": 2.042,
+ "step": 920
+ },
+ {
+ "entropy": 0.623173613846302,
+ "epoch": 2.2655401327700666,
+ "grad_norm": 0.8366610407829285,
+ "learning_rate": 0.00035830638562997063,
+ "loss": 0.5488213539123535,
+ "mean_token_accuracy": 0.8321483485400677,
+ "num_tokens": 2183144.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.2655401327700666,
+ "eval_entropy": 0.6237085649136747,
+ "eval_loss": 0.68075031042099,
+ "eval_mean_token_accuracy": 0.814671738429016,
+ "eval_num_tokens": 2183144.0,
+ "eval_runtime": 88.0652,
+ "eval_samples_per_second": 16.124,
+ "eval_steps_per_second": 2.021,
+ "step": 940
+ },
+ {
+ "entropy": 0.6236911740154027,
+ "epoch": 2.3138201569100785,
+ "grad_norm": 0.7812452912330627,
+ "learning_rate": 0.00035693211783557416,
+ "loss": 0.5696200847625732,
+ "mean_token_accuracy": 0.82991396561265,
+ "num_tokens": 2228098.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3138201569100785,
+ "eval_entropy": 0.6327033426319615,
+ "eval_loss": 0.6742984652519226,
+ "eval_mean_token_accuracy": 0.8148086091105857,
+ "eval_num_tokens": 2228098.0,
+ "eval_runtime": 88.1711,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 960
+ },
+ {
+ "entropy": 0.6218426413834095,
+ "epoch": 2.3621001810500903,
+ "grad_norm": 0.8719790577888489,
+ "learning_rate": 0.0003555100848215035,
+ "loss": 0.5582651615142822,
+ "mean_token_accuracy": 0.8323961742222309,
+ "num_tokens": 2273062.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.3621001810500903,
+ "eval_entropy": 0.6338012375858393,
+ "eval_loss": 0.6685822606086731,
+ "eval_mean_token_accuracy": 0.8152180300669724,
+ "eval_num_tokens": 2273062.0,
+ "eval_runtime": 88.101,
+ "eval_samples_per_second": 16.118,
+ "eval_steps_per_second": 2.02,
+ "step": 980
+ },
+ {
+ "entropy": 0.6050681818276644,
+ "epoch": 2.4103802051901027,
+ "grad_norm": 0.9151566028594971,
+ "learning_rate": 0.00035404068900628076,
+ "loss": 0.559452486038208,
+ "mean_token_accuracy": 0.8310242861509323,
+ "num_tokens": 2319305.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.4103802051901027,
+ "eval_entropy": 0.6634890969549672,
+ "eval_loss": 0.6692465543746948,
+ "eval_mean_token_accuracy": 0.8134353673190213,
+ "eval_num_tokens": 2319305.0,
+ "eval_runtime": 87.7711,
+ "eval_samples_per_second": 16.178,
+ "eval_steps_per_second": 2.028,
+ "step": 1000
+ },
+ {
+ "entropy": 0.6169968567788601,
+ "epoch": 2.4586602293301145,
+ "grad_norm": 0.7081006765365601,
+ "learning_rate": 0.0003525243462115402,
+ "loss": 0.5589694023132324,
+ "mean_token_accuracy": 0.8357502184808254,
+ "num_tokens": 2368592.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.4586602293301145,
+ "eval_entropy": 0.6126393578695447,
+ "eval_loss": 0.6706712245941162,
+ "eval_mean_token_accuracy": 0.8155577500884452,
+ "eval_num_tokens": 2368592.0,
+ "eval_runtime": 88.1407,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.019,
+ "step": 1020
+ },
+ {
+ "entropy": 0.6072248566895724,
+ "epoch": 2.506940253470127,
+ "grad_norm": 0.6999370455741882,
+ "learning_rate": 0.0003509614855443561,
+ "loss": 0.5500593185424805,
+ "mean_token_accuracy": 0.8337264291942119,
+ "num_tokens": 2412859.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.506940253470127,
+ "eval_entropy": 0.6417417074187418,
+ "eval_loss": 0.6651163697242737,
+ "eval_mean_token_accuracy": 0.8159113908081912,
+ "eval_num_tokens": 2412859.0,
+ "eval_runtime": 87.4854,
+ "eval_samples_per_second": 16.231,
+ "eval_steps_per_second": 2.035,
+ "step": 1040
+ },
+ {
+ "entropy": 0.6301592070609331,
+ "epoch": 2.5552202776101387,
+ "grad_norm": 0.8768910765647888,
+ "learning_rate": 0.00034935254927581064,
+ "loss": 0.5613903999328613,
+ "mean_token_accuracy": 0.8298896946012974,
+ "num_tokens": 2458201.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.5552202776101387,
+ "eval_entropy": 0.6569794751285167,
+ "eval_loss": 0.6668341159820557,
+ "eval_mean_token_accuracy": 0.8126791795987761,
+ "eval_num_tokens": 2458201.0,
+ "eval_runtime": 88.0474,
+ "eval_samples_per_second": 16.128,
+ "eval_steps_per_second": 2.022,
+ "step": 1060
+ },
+ {
+ "entropy": 0.6069021724164486,
+ "epoch": 2.603500301750151,
+ "grad_norm": 0.9033508896827698,
+ "learning_rate": 0.0003476979927158357,
+ "loss": 0.5590654373168945,
+ "mean_token_accuracy": 0.831520090252161,
+ "num_tokens": 2505382.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.603500301750151,
+ "eval_entropy": 0.6636380777600106,
+ "eval_loss": 0.6596238017082214,
+ "eval_mean_token_accuracy": 0.8177202826135614,
+ "eval_num_tokens": 2505382.0,
+ "eval_runtime": 88.08,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1080
+ },
+ {
+ "entropy": 0.6138021353632211,
+ "epoch": 2.651780325890163,
+ "grad_norm": 0.7345808148384094,
+ "learning_rate": 0.0003459982840843664,
+ "loss": 0.5586410522460937,
+ "mean_token_accuracy": 0.8295876093208789,
+ "num_tokens": 2552927.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.651780325890163,
+ "eval_entropy": 0.5845904127600487,
+ "eval_loss": 0.663780689239502,
+ "eval_mean_token_accuracy": 0.8142095107710763,
+ "eval_num_tokens": 2552927.0,
+ "eval_runtime": 88.0083,
+ "eval_samples_per_second": 16.135,
+ "eval_steps_per_second": 2.023,
+ "step": 1100
+ },
+ {
+ "entropy": 0.6251844003796577,
+ "epoch": 2.700060350030175,
+ "grad_norm": 0.7587347626686096,
+ "learning_rate": 0.00034425390437883976,
+ "loss": 0.5720802307128906,
+ "mean_token_accuracy": 0.8285771444439888,
+ "num_tokens": 2597426.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.700060350030175,
+ "eval_entropy": 0.6251207221759839,
+ "eval_loss": 0.6556326746940613,
+ "eval_mean_token_accuracy": 0.8181774036937886,
+ "eval_num_tokens": 2597426.0,
+ "eval_runtime": 87.8517,
+ "eval_samples_per_second": 16.164,
+ "eval_steps_per_second": 2.026,
+ "step": 1120
+ },
+ {
+ "entropy": 0.6227757651358843,
+ "epoch": 2.748340374170187,
+ "grad_norm": 0.9254975914955139,
+ "learning_rate": 0.00034246534723807843,
+ "loss": 0.5767871856689453,
+ "mean_token_accuracy": 0.8292960874736309,
+ "num_tokens": 2640514.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.748340374170187,
+ "eval_entropy": 0.6580858331048087,
+ "eval_loss": 0.6579018831253052,
+ "eval_mean_token_accuracy": 0.8178701273510965,
+ "eval_num_tokens": 2640514.0,
+ "eval_runtime": 87.9523,
+ "eval_samples_per_second": 16.145,
+ "eval_steps_per_second": 2.024,
+ "step": 1140
+ },
+ {
+ "entropy": 0.6353523321449757,
+ "epoch": 2.796620398310199,
+ "grad_norm": 1.4437663555145264,
+ "learning_rate": 0.00034063311880259663,
+ "loss": 0.566702127456665,
+ "mean_token_accuracy": 0.831210870295763,
+ "num_tokens": 2687730.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.796620398310199,
+ "eval_entropy": 0.6347215423423253,
+ "eval_loss": 0.6531020402908325,
+ "eval_mean_token_accuracy": 0.8189373260803436,
+ "eval_num_tokens": 2687730.0,
+ "eval_runtime": 88.0207,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1160
+ },
+ {
+ "entropy": 0.6233414955437183,
+ "epoch": 2.8449004224502112,
+ "grad_norm": 0.753302812576294,
+ "learning_rate": 0.0003387577375713684,
+ "loss": 0.5740012645721435,
+ "mean_token_accuracy": 0.8270302519202233,
+ "num_tokens": 2732930.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.8449004224502112,
+ "eval_entropy": 0.6291426423560368,
+ "eval_loss": 0.6549608707427979,
+ "eval_mean_token_accuracy": 0.8188753693961026,
+ "eval_num_tokens": 2732930.0,
+ "eval_runtime": 88.2306,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1180
+ },
+ {
+ "entropy": 0.617981968075037,
+ "epoch": 2.8931804465902236,
+ "grad_norm": 0.6777492165565491,
+ "learning_rate": 0.00033683973425509874,
+ "loss": 0.5558822631835938,
+ "mean_token_accuracy": 0.8315935507416725,
+ "num_tokens": 2779450.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.8931804465902236,
+ "eval_entropy": 0.6340839514571629,
+ "eval_loss": 0.6490646600723267,
+ "eval_mean_token_accuracy": 0.8200173856837026,
+ "eval_num_tokens": 2779450.0,
+ "eval_runtime": 88.3076,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1200
+ },
+ {
+ "entropy": 0.5989151727408171,
+ "epoch": 2.9414604707302354,
+ "grad_norm": 1.0503766536712646,
+ "learning_rate": 0.0003348796516260381,
+ "loss": 0.550087308883667,
+ "mean_token_accuracy": 0.8357349015772343,
+ "num_tokens": 2827819.0,
+ "step": 1220
+ },
+ {
+ "epoch": 2.9414604707302354,
+ "eval_entropy": 0.6683844726407127,
+ "eval_loss": 0.6455520987510681,
+ "eval_mean_token_accuracy": 0.8199967946229356,
+ "eval_num_tokens": 2827819.0,
+ "eval_runtime": 87.7825,
+ "eval_samples_per_second": 16.176,
+ "eval_steps_per_second": 2.028,
+ "step": 1220
+ },
+ {
+ "entropy": 0.6396764755249024,
+ "epoch": 2.9897404948702473,
+ "grad_norm": 0.7088311910629272,
+ "learning_rate": 0.00033287804436438515,
+ "loss": 0.5731344223022461,
+ "mean_token_accuracy": 0.8298504173755645,
+ "num_tokens": 2872493.0,
+ "step": 1240
+ },
+ {
+ "epoch": 2.9897404948702473,
+ "eval_entropy": 0.6510144954317072,
+ "eval_loss": 0.6509669423103333,
+ "eval_mean_token_accuracy": 0.8188618431600292,
+ "eval_num_tokens": 2872493.0,
+ "eval_runtime": 87.8954,
+ "eval_samples_per_second": 16.156,
+ "eval_steps_per_second": 2.025,
+ "step": 1240
+ },
+ {
+ "entropy": 0.5436535887903982,
+ "epoch": 3.036210018105009,
+ "grad_norm": 0.8652629852294922,
+ "learning_rate": 0.00033083547890131815,
+ "loss": 0.4816119194030762,
+ "mean_token_accuracy": 0.8523989869402601,
+ "num_tokens": 2918249.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.036210018105009,
+ "eval_entropy": 0.5676146091035242,
+ "eval_loss": 0.6723794341087341,
+ "eval_mean_token_accuracy": 0.8197960103495737,
+ "eval_num_tokens": 2918249.0,
+ "eval_runtime": 88.1303,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1260
+ },
+ {
+ "entropy": 0.503798121958971,
+ "epoch": 3.084490042245021,
+ "grad_norm": 0.9403247237205505,
+ "learning_rate": 0.0003287525332587019,
+ "loss": 0.43859500885009767,
+ "mean_token_accuracy": 0.8604862734675407,
+ "num_tokens": 2968353.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.084490042245021,
+ "eval_entropy": 0.5981672088081917,
+ "eval_loss": 0.671315610408783,
+ "eval_mean_token_accuracy": 0.8175233046660263,
+ "eval_num_tokens": 2968353.0,
+ "eval_runtime": 88.3097,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1280
+ },
+ {
+ "entropy": 0.5218576818704606,
+ "epoch": 3.1327700663850333,
+ "grad_norm": 1.0271061658859253,
+ "learning_rate": 0.0003266297968855144,
+ "loss": 0.45096940994262696,
+ "mean_token_accuracy": 0.8555397011339665,
+ "num_tokens": 3018291.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.1327700663850333,
+ "eval_entropy": 0.5708769342202819,
+ "eval_loss": 0.6631077527999878,
+ "eval_mean_token_accuracy": 0.8207426647121987,
+ "eval_num_tokens": 3018291.0,
+ "eval_runtime": 87.7272,
+ "eval_samples_per_second": 16.187,
+ "eval_steps_per_second": 2.029,
+ "step": 1300
+ },
+ {
+ "entropy": 0.5191332377493382,
+ "epoch": 3.181050090525045,
+ "grad_norm": 0.958055317401886,
+ "learning_rate": 0.0003244678704910397,
+ "loss": 0.45679512023925783,
+ "mean_token_accuracy": 0.8554921194911003,
+ "num_tokens": 3070712.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.181050090525045,
+ "eval_entropy": 0.5703962919082535,
+ "eval_loss": 0.6597784161567688,
+ "eval_mean_token_accuracy": 0.821146364962117,
+ "eval_num_tokens": 3070712.0,
+ "eval_runtime": 88.4154,
+ "eval_samples_per_second": 16.061,
+ "eval_steps_per_second": 2.013,
+ "step": 1320
+ },
+ {
+ "entropy": 0.5207117382436991,
+ "epoch": 3.2293301146650575,
+ "grad_norm": 0.7903274297714233,
+ "learning_rate": 0.00032226736587487434,
+ "loss": 0.44762430191040037,
+ "mean_token_accuracy": 0.8578196220099926,
+ "num_tokens": 3116564.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.2293301146650575,
+ "eval_entropy": 0.5453257858753204,
+ "eval_loss": 0.6688455939292908,
+ "eval_mean_token_accuracy": 0.8215647212574991,
+ "eval_num_tokens": 3116564.0,
+ "eval_runtime": 88.0214,
+ "eval_samples_per_second": 16.132,
+ "eval_steps_per_second": 2.022,
+ "step": 1340
+ },
+ {
+ "entropy": 0.5263226825743914,
+ "epoch": 3.2776101388050694,
+ "grad_norm": 0.8782205581665039,
+ "learning_rate": 0.00032002890575379524,
+ "loss": 0.46592864990234373,
+ "mean_token_accuracy": 0.8551752805709839,
+ "num_tokens": 3164054.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.2776101388050694,
+ "eval_entropy": 0.5805480952343244,
+ "eval_loss": 0.6707106232643127,
+ "eval_mean_token_accuracy": 0.8191288441754458,
+ "eval_num_tokens": 3164054.0,
+ "eval_runtime": 88.2293,
+ "eval_samples_per_second": 16.094,
+ "eval_steps_per_second": 2.017,
+ "step": 1360
+ },
+ {
+ "entropy": 0.5454599127173424,
+ "epoch": 3.3258901629450817,
+ "grad_norm": 0.9048764705657959,
+ "learning_rate": 0.0003177531235855382,
+ "loss": 0.4763782501220703,
+ "mean_token_accuracy": 0.8505888104438781,
+ "num_tokens": 3207419.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.3258901629450817,
+ "eval_entropy": 0.5952914317002457,
+ "eval_loss": 0.662697970867157,
+ "eval_mean_token_accuracy": 0.819491108146946,
+ "eval_num_tokens": 3207419.0,
+ "eval_runtime": 87.9869,
+ "eval_samples_per_second": 16.139,
+ "eval_steps_per_second": 2.023,
+ "step": 1380
+ },
+ {
+ "entropy": 0.5299010306596756,
+ "epoch": 3.3741701870850935,
+ "grad_norm": 0.8653950691223145,
+ "learning_rate": 0.000315440663389537,
+ "loss": 0.4581890106201172,
+ "mean_token_accuracy": 0.8536585591733455,
+ "num_tokens": 3252679.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.3741701870850935,
+ "eval_entropy": 0.5326506612675913,
+ "eval_loss": 0.6679039001464844,
+ "eval_mean_token_accuracy": 0.8209870109397374,
+ "eval_num_tokens": 3252679.0,
+ "eval_runtime": 88.3059,
+ "eval_samples_per_second": 16.08,
+ "eval_steps_per_second": 2.016,
+ "step": 1400
+ },
+ {
+ "entropy": 0.5074611511081457,
+ "epoch": 3.4224502112251054,
+ "grad_norm": 0.7786624431610107,
+ "learning_rate": 0.00031309217956467325,
+ "loss": 0.45597033500671386,
+ "mean_token_accuracy": 0.856324628740549,
+ "num_tokens": 3297309.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.4224502112251054,
+ "eval_entropy": 0.5424539073464576,
+ "eval_loss": 0.6710956692695618,
+ "eval_mean_token_accuracy": 0.8209191105338964,
+ "eval_num_tokens": 3297309.0,
+ "eval_runtime": 87.2334,
+ "eval_samples_per_second": 16.278,
+ "eval_steps_per_second": 2.041,
+ "step": 1420
+ },
+ {
+ "entropy": 0.5192026473581791,
+ "epoch": 3.4707302353651177,
+ "grad_norm": 0.7682847380638123,
+ "learning_rate": 0.0003107083367040895,
+ "loss": 0.46319098472595216,
+ "mean_token_accuracy": 0.8517456069588661,
+ "num_tokens": 3341825.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.4707302353651177,
+ "eval_entropy": 0.569345246372598,
+ "eval_loss": 0.6640089154243469,
+ "eval_mean_token_accuracy": 0.8204013628236363,
+ "eval_num_tokens": 3341825.0,
+ "eval_runtime": 87.668,
+ "eval_samples_per_second": 16.197,
+ "eval_steps_per_second": 2.03,
+ "step": 1440
+ },
+ {
+ "entropy": 0.5302285175770521,
+ "epoch": 3.51901025950513,
+ "grad_norm": 0.9500018954277039,
+ "learning_rate": 0.00030828980940711723,
+ "loss": 0.4712235927581787,
+ "mean_token_accuracy": 0.8510453663766384,
+ "num_tokens": 3388463.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.51901025950513,
+ "eval_entropy": 0.5648383499866121,
+ "eval_loss": 0.6629963517189026,
+ "eval_mean_token_accuracy": 0.8197558281126986,
+ "eval_num_tokens": 3388463.0,
+ "eval_runtime": 87.9214,
+ "eval_samples_per_second": 16.151,
+ "eval_steps_per_second": 2.025,
+ "step": 1460
+ },
+ {
+ "entropy": 0.5347354769706726,
+ "epoch": 3.567290283645142,
+ "grad_norm": 0.9935700297355652,
+ "learning_rate": 0.00030583728208837305,
+ "loss": 0.47901196479797364,
+ "mean_token_accuracy": 0.8491650126874447,
+ "num_tokens": 3433731.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.567290283645142,
+ "eval_entropy": 0.5595698517360045,
+ "eval_loss": 0.6594937443733215,
+ "eval_mean_token_accuracy": 0.8217685289597243,
+ "eval_num_tokens": 3433731.0,
+ "eval_runtime": 88.1348,
+ "eval_samples_per_second": 16.112,
+ "eval_steps_per_second": 2.02,
+ "step": 1480
+ },
+ {
+ "entropy": 0.5250448524951935,
+ "epoch": 3.6155703077851538,
+ "grad_norm": 0.8686122894287109,
+ "learning_rate": 0.0003033514487840775,
+ "loss": 0.48284616470336916,
+ "mean_token_accuracy": 0.8505332618951797,
+ "num_tokens": 3478600.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.6155703077851538,
+ "eval_entropy": 0.5399963330017047,
+ "eval_loss": 0.6682186722755432,
+ "eval_mean_token_accuracy": 0.8201540199558387,
+ "eval_num_tokens": 3478600.0,
+ "eval_runtime": 87.9383,
+ "eval_samples_per_second": 16.148,
+ "eval_steps_per_second": 2.024,
+ "step": 1500
+ },
+ {
+ "entropy": 0.5496356297284365,
+ "epoch": 3.663850331925166,
+ "grad_norm": 0.9891234636306763,
+ "learning_rate": 0.00030083301295565117,
+ "loss": 0.4842066287994385,
+ "mean_token_accuracy": 0.8493696190416813,
+ "num_tokens": 3521787.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.663850331925166,
+ "eval_entropy": 0.5889502502559276,
+ "eval_loss": 0.6597762703895569,
+ "eval_mean_token_accuracy": 0.819690072469497,
+ "eval_num_tokens": 3521787.0,
+ "eval_runtime": 88.0165,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1520
+ },
+ {
+ "entropy": 0.5289484921842813,
+ "epoch": 3.712130356065178,
+ "grad_norm": 0.7241885662078857,
+ "learning_rate": 0.00029828268729064326,
+ "loss": 0.48619561195373534,
+ "mean_token_accuracy": 0.8518108949065208,
+ "num_tokens": 3569036.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.712130356065178,
+ "eval_entropy": 0.5958652837892596,
+ "eval_loss": 0.6565147042274475,
+ "eval_mean_token_accuracy": 0.8217123010185328,
+ "eval_num_tokens": 3569036.0,
+ "eval_runtime": 88.0126,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1540
+ },
+ {
+ "entropy": 0.5450621031224727,
+ "epoch": 3.7604103802051903,
+ "grad_norm": 0.7989155650138855,
+ "learning_rate": 0.0002957011935010495,
+ "loss": 0.48642635345458984,
+ "mean_token_accuracy": 0.8462958924472332,
+ "num_tokens": 3614313.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.7604103802051903,
+ "eval_entropy": 0.5554354205895006,
+ "eval_loss": 0.6484317183494568,
+ "eval_mean_token_accuracy": 0.823845865016573,
+ "eval_num_tokens": 3614313.0,
+ "eval_runtime": 88.2711,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1560
+ },
+ {
+ "entropy": 0.5318546604365111,
+ "epoch": 3.808690404345202,
+ "grad_norm": 1.0375983715057373,
+ "learning_rate": 0.00029308926211907624,
+ "loss": 0.4860549449920654,
+ "mean_token_accuracy": 0.8488477177917957,
+ "num_tokens": 3659786.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.808690404345202,
+ "eval_entropy": 0.5575427207049359,
+ "eval_loss": 0.659203827381134,
+ "eval_mean_token_accuracy": 0.8210098288032446,
+ "eval_num_tokens": 3659786.0,
+ "eval_runtime": 88.3024,
+ "eval_samples_per_second": 16.081,
+ "eval_steps_per_second": 2.016,
+ "step": 1580
+ },
+ {
+ "entropy": 0.5312924966216087,
+ "epoch": 3.856970428485214,
+ "grad_norm": 0.9233641624450684,
+ "learning_rate": 0.00029044763229040845,
+ "loss": 0.48835930824279783,
+ "mean_token_accuracy": 0.8447530090808868,
+ "num_tokens": 3706362.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.856970428485214,
+ "eval_entropy": 0.5433843780434533,
+ "eval_loss": 0.6514624953269958,
+ "eval_mean_token_accuracy": 0.8230627580974879,
+ "eval_num_tokens": 3706362.0,
+ "eval_runtime": 87.9727,
+ "eval_samples_per_second": 16.141,
+ "eval_steps_per_second": 2.023,
+ "step": 1600
+ },
+ {
+ "entropy": 0.5400687273591757,
+ "epoch": 3.9052504526252263,
+ "grad_norm": 0.7173060178756714,
+ "learning_rate": 0.00028777705156504007,
+ "loss": 0.486147403717041,
+ "mean_token_accuracy": 0.8478169530630112,
+ "num_tokens": 3753013.0,
+ "step": 1620
+ },
+ {
+ "epoch": 3.9052504526252263,
+ "eval_entropy": 0.5856067625324378,
+ "eval_loss": 0.6469284892082214,
+ "eval_mean_token_accuracy": 0.8219244604030352,
+ "eval_num_tokens": 3753013.0,
+ "eval_runtime": 88.0776,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1620
+ },
+ {
+ "entropy": 0.5115721028298139,
+ "epoch": 3.9535304767652386,
+ "grad_norm": 1.0881255865097046,
+ "learning_rate": 0.00028507827568572655,
+ "loss": 0.47065014839172364,
+ "mean_token_accuracy": 0.8535217240452766,
+ "num_tokens": 3800024.0,
+ "step": 1640
+ },
+ {
+ "epoch": 3.9535304767652386,
+ "eval_entropy": 0.565960791003838,
+ "eval_loss": 0.6459378004074097,
+ "eval_mean_token_accuracy": 0.8246003888296277,
+ "eval_num_tokens": 3800024.0,
+ "eval_runtime": 88.4974,
+ "eval_samples_per_second": 16.046,
+ "eval_steps_per_second": 2.011,
+ "step": 1640
+ },
+ {
+ "entropy": 0.5376694152107486,
+ "epoch": 4.0,
+ "grad_norm": 3.4068243503570557,
+ "learning_rate": 0.0002823520683741183,
+ "loss": 0.4839733600616455,
+ "mean_token_accuracy": 0.8507238850965129,
+ "num_tokens": 3844304.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.0,
+ "eval_entropy": 0.5631327726198047,
+ "eval_loss": 0.6423600316047668,
+ "eval_mean_token_accuracy": 0.82502972175566,
+ "eval_num_tokens": 3844304.0,
+ "eval_runtime": 88.1524,
+ "eval_samples_per_second": 16.108,
+ "eval_steps_per_second": 2.019,
+ "step": 1660
+ },
+ {
+ "entropy": 0.4188325941562653,
+ "epoch": 4.048280024140012,
+ "grad_norm": 0.6339647173881531,
+ "learning_rate": 0.00027959920111463656,
+ "loss": 0.3500279426574707,
+ "mean_token_accuracy": 0.8840543255209923,
+ "num_tokens": 3890738.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.048280024140012,
+ "eval_entropy": 0.5159014272555876,
+ "eval_loss": 0.6822672486305237,
+ "eval_mean_token_accuracy": 0.8223584498582261,
+ "eval_num_tokens": 3890738.0,
+ "eval_runtime": 87.8011,
+ "eval_samples_per_second": 16.173,
+ "eval_steps_per_second": 2.027,
+ "step": 1680
+ },
+ {
+ "entropy": 0.42600946351885793,
+ "epoch": 4.096560048280024,
+ "grad_norm": 0.6938858032226562,
+ "learning_rate": 0.0002768204529361524,
+ "loss": 0.3462975263595581,
+ "mean_token_accuracy": 0.8850771695375442,
+ "num_tokens": 3938205.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.096560048280024,
+ "eval_entropy": 0.4818309486916896,
+ "eval_loss": 0.697238028049469,
+ "eval_mean_token_accuracy": 0.822570590825563,
+ "eval_num_tokens": 3938205.0,
+ "eval_runtime": 87.6294,
+ "eval_samples_per_second": 16.205,
+ "eval_steps_per_second": 2.031,
+ "step": 1700
+ },
+ {
+ "entropy": 0.4128956265747547,
+ "epoch": 4.1448400724200365,
+ "grad_norm": 0.7023837566375732,
+ "learning_rate": 0.000274016610191531,
+ "loss": 0.35343332290649415,
+ "mean_token_accuracy": 0.8837565891444683,
+ "num_tokens": 3986350.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.1448400724200365,
+ "eval_entropy": 0.4736787666765492,
+ "eval_loss": 0.686392605304718,
+ "eval_mean_token_accuracy": 0.8246323891570059,
+ "eval_num_tokens": 3986350.0,
+ "eval_runtime": 87.755,
+ "eval_samples_per_second": 16.181,
+ "eval_steps_per_second": 2.028,
+ "step": 1720
+ },
+ {
+ "entropy": 0.4070820797234774,
+ "epoch": 4.193120096560048,
+ "grad_norm": 0.7664099335670471,
+ "learning_rate": 0.00027118846633510276,
+ "loss": 0.35689282417297363,
+ "mean_token_accuracy": 0.8821764968335628,
+ "num_tokens": 4033541.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.193120096560048,
+ "eval_entropy": 0.48123268063148755,
+ "eval_loss": 0.6800221800804138,
+ "eval_mean_token_accuracy": 0.8234515280536051,
+ "eval_num_tokens": 4033541.0,
+ "eval_runtime": 87.613,
+ "eval_samples_per_second": 16.208,
+ "eval_steps_per_second": 2.032,
+ "step": 1740
+ },
+ {
+ "entropy": 0.4199690703302622,
+ "epoch": 4.24140012070006,
+ "grad_norm": 0.7411720752716064,
+ "learning_rate": 0.00026833682169812544,
+ "loss": 0.35881006717681885,
+ "mean_token_accuracy": 0.8812312394380569,
+ "num_tokens": 4079253.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.24140012070006,
+ "eval_entropy": 0.47287314242861245,
+ "eval_loss": 0.691737949848175,
+ "eval_mean_token_accuracy": 0.8229516232281588,
+ "eval_num_tokens": 4079253.0,
+ "eval_runtime": 87.9596,
+ "eval_samples_per_second": 16.144,
+ "eval_steps_per_second": 2.024,
+ "step": 1760
+ },
+ {
+ "entropy": 0.4195733394473791,
+ "epoch": 4.289680144840072,
+ "grad_norm": 0.9975268244743347,
+ "learning_rate": 0.00026546248326229954,
+ "loss": 0.36998801231384276,
+ "mean_token_accuracy": 0.8777976937592029,
+ "num_tokens": 4125495.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.289680144840072,
+ "eval_entropy": 0.48877454825331657,
+ "eval_loss": 0.6843481063842773,
+ "eval_mean_token_accuracy": 0.8226028995567494,
+ "eval_num_tokens": 4125495.0,
+ "eval_runtime": 88.169,
+ "eval_samples_per_second": 16.105,
+ "eval_steps_per_second": 2.019,
+ "step": 1780
+ },
+ {
+ "entropy": 0.4087799321860075,
+ "epoch": 4.337960168980085,
+ "grad_norm": 0.8101420402526855,
+ "learning_rate": 0.00026256626443140217,
+ "loss": 0.3555623531341553,
+ "mean_token_accuracy": 0.8815289497375488,
+ "num_tokens": 4173422.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.337960168980085,
+ "eval_entropy": 0.4845838766084628,
+ "eval_loss": 0.6782916188240051,
+ "eval_mean_token_accuracy": 0.8235659428526846,
+ "eval_num_tokens": 4173422.0,
+ "eval_runtime": 88.0763,
+ "eval_samples_per_second": 16.122,
+ "eval_steps_per_second": 2.021,
+ "step": 1800
+ },
+ {
+ "entropy": 0.4086425334215164,
+ "epoch": 4.386240193120097,
+ "grad_norm": 0.8936498761177063,
+ "learning_rate": 0.0002596489848011036,
+ "loss": 0.3710860013961792,
+ "mean_token_accuracy": 0.8773891530930996,
+ "num_tokens": 4216243.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.386240193120097,
+ "eval_entropy": 0.49018637685293565,
+ "eval_loss": 0.6762362718582153,
+ "eval_mean_token_accuracy": 0.8242661363623115,
+ "eval_num_tokens": 4216243.0,
+ "eval_runtime": 88.3684,
+ "eval_samples_per_second": 16.069,
+ "eval_steps_per_second": 2.014,
+ "step": 1820
+ },
+ {
+ "entropy": 0.41956189945340155,
+ "epoch": 4.434520217260109,
+ "grad_norm": 0.6450079083442688,
+ "learning_rate": 0.00025671146992703106,
+ "loss": 0.3715682029724121,
+ "mean_token_accuracy": 0.878043319284916,
+ "num_tokens": 4262463.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.434520217260109,
+ "eval_entropy": 0.4821142643020394,
+ "eval_loss": 0.6749269962310791,
+ "eval_mean_token_accuracy": 0.8252766048640348,
+ "eval_num_tokens": 4262463.0,
+ "eval_runtime": 87.6946,
+ "eval_samples_per_second": 16.193,
+ "eval_steps_per_second": 2.03,
+ "step": 1840
+ },
+ {
+ "entropy": 0.40638086050748823,
+ "epoch": 4.4828002414001205,
+ "grad_norm": 0.8167530298233032,
+ "learning_rate": 0.0002537545510911465,
+ "loss": 0.3652146100997925,
+ "mean_token_accuracy": 0.8761600315570831,
+ "num_tokens": 4311451.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.4828002414001205,
+ "eval_entropy": 0.5017492558514134,
+ "eval_loss": 0.6696512699127197,
+ "eval_mean_token_accuracy": 0.8252955695216575,
+ "eval_num_tokens": 4311451.0,
+ "eval_runtime": 88.02,
+ "eval_samples_per_second": 16.133,
+ "eval_steps_per_second": 2.022,
+ "step": 1860
+ },
+ {
+ "entropy": 0.41664722077548505,
+ "epoch": 4.531080265540133,
+ "grad_norm": 0.757738471031189,
+ "learning_rate": 0.0002507790650665036,
+ "loss": 0.368887734413147,
+ "mean_token_accuracy": 0.8786893397569656,
+ "num_tokens": 4357724.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.531080265540133,
+ "eval_entropy": 0.4798511176296834,
+ "eval_loss": 0.6738249659538269,
+ "eval_mean_token_accuracy": 0.8250340461061242,
+ "eval_num_tokens": 4357724.0,
+ "eval_runtime": 88.2713,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 1880
+ },
+ {
+ "entropy": 0.42732664197683334,
+ "epoch": 4.579360289680145,
+ "grad_norm": 0.7890474200248718,
+ "learning_rate": 0.00024778585388045044,
+ "loss": 0.38672595024108886,
+ "mean_token_accuracy": 0.8742976360023021,
+ "num_tokens": 4401934.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.579360289680145,
+ "eval_entropy": 0.49321879295820603,
+ "eval_loss": 0.6752269268035889,
+ "eval_mean_token_accuracy": 0.824115453811174,
+ "eval_num_tokens": 4401934.0,
+ "eval_runtime": 87.3378,
+ "eval_samples_per_second": 16.259,
+ "eval_steps_per_second": 2.038,
+ "step": 1900
+ },
+ {
+ "entropy": 0.41300065964460375,
+ "epoch": 4.627640313820157,
+ "grad_norm": 0.866765022277832,
+ "learning_rate": 0.00024477576457634665,
+ "loss": 0.364247989654541,
+ "mean_token_accuracy": 0.8774793080985546,
+ "num_tokens": 4449745.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.627640313820157,
+ "eval_entropy": 0.49179744352115673,
+ "eval_loss": 0.6731056571006775,
+ "eval_mean_token_accuracy": 0.8245729244826885,
+ "eval_num_tokens": 4449745.0,
+ "eval_runtime": 88.2458,
+ "eval_samples_per_second": 16.091,
+ "eval_steps_per_second": 2.017,
+ "step": 1920
+ },
+ {
+ "entropy": 0.42646181732416155,
+ "epoch": 4.675920337960169,
+ "grad_norm": 0.7921772003173828,
+ "learning_rate": 0.00024174964897385928,
+ "loss": 0.3822937488555908,
+ "mean_token_accuracy": 0.8755100265145301,
+ "num_tokens": 4495074.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.675920337960169,
+ "eval_entropy": 0.5194089940089858,
+ "eval_loss": 0.6604889631271362,
+ "eval_mean_token_accuracy": 0.8260471847619903,
+ "eval_num_tokens": 4495074.0,
+ "eval_runtime": 88.0139,
+ "eval_samples_per_second": 16.134,
+ "eval_steps_per_second": 2.022,
+ "step": 1940
+ },
+ {
+ "entropy": 0.4235709119588137,
+ "epoch": 4.724200362100181,
+ "grad_norm": 0.8816011548042297,
+ "learning_rate": 0.00023870836342790837,
+ "loss": 0.3772272109985352,
+ "mean_token_accuracy": 0.8731484808027744,
+ "num_tokens": 4541053.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.724200362100181,
+ "eval_entropy": 0.47387497545628066,
+ "eval_loss": 0.6644074320793152,
+ "eval_mean_token_accuracy": 0.8271099258674665,
+ "eval_num_tokens": 4541053.0,
+ "eval_runtime": 88.393,
+ "eval_samples_per_second": 16.065,
+ "eval_steps_per_second": 2.014,
+ "step": 1960
+ },
+ {
+ "entropy": 0.42933564484119413,
+ "epoch": 4.772480386240193,
+ "grad_norm": 0.9746852517127991,
+ "learning_rate": 0.0002356527685863284,
+ "loss": 0.3843918561935425,
+ "mean_token_accuracy": 0.873461090028286,
+ "num_tokens": 4584210.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.772480386240193,
+ "eval_entropy": 0.47977291734031074,
+ "eval_loss": 0.6671409010887146,
+ "eval_mean_token_accuracy": 0.8273240890395775,
+ "eval_num_tokens": 4584210.0,
+ "eval_runtime": 88.6022,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.009,
+ "step": 1980
+ },
+ {
+ "entropy": 0.44694459773600104,
+ "epoch": 4.820760410380205,
+ "grad_norm": 0.7372738122940063,
+ "learning_rate": 0.00023258372914631542,
+ "loss": 0.38873090744018557,
+ "mean_token_accuracy": 0.871940117329359,
+ "num_tokens": 4630254.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.820760410380205,
+ "eval_entropy": 0.49700497023844986,
+ "eval_loss": 0.6683036088943481,
+ "eval_mean_token_accuracy": 0.8265726067376941,
+ "eval_num_tokens": 4630254.0,
+ "eval_runtime": 88.1382,
+ "eval_samples_per_second": 16.111,
+ "eval_steps_per_second": 2.02,
+ "step": 2000
+ },
+ {
+ "entropy": 0.42922686524689196,
+ "epoch": 4.869040434520217,
+ "grad_norm": 0.6791961789131165,
+ "learning_rate": 0.0002295021136097277,
+ "loss": 0.3735378265380859,
+ "mean_token_accuracy": 0.8772910334169864,
+ "num_tokens": 4679265.0,
+ "step": 2020
+ },
+ {
+ "epoch": 4.869040434520217,
+ "eval_entropy": 0.49750003386079594,
+ "eval_loss": 0.66725093126297,
+ "eval_mean_token_accuracy": 0.8255943565556173,
+ "eval_num_tokens": 4679265.0,
+ "eval_runtime": 86.9873,
+ "eval_samples_per_second": 16.324,
+ "eval_steps_per_second": 2.046,
+ "step": 2020
+ },
+ {
+ "entropy": 0.4518359176814556,
+ "epoch": 4.917320458660229,
+ "grad_norm": 0.7970417141914368,
+ "learning_rate": 0.00022640879403731002,
+ "loss": 0.38829789161682127,
+ "mean_token_accuracy": 0.8700004398822785,
+ "num_tokens": 4723592.0,
+ "step": 2040
+ },
+ {
+ "epoch": 4.917320458660229,
+ "eval_entropy": 0.4902817869789145,
+ "eval_loss": 0.6645081639289856,
+ "eval_mean_token_accuracy": 0.8280317391572374,
+ "eval_num_tokens": 4723592.0,
+ "eval_runtime": 87.4334,
+ "eval_samples_per_second": 16.241,
+ "eval_steps_per_second": 2.036,
+ "step": 2040
+ },
+ {
+ "entropy": 0.4405197504907846,
+ "epoch": 4.965600482800241,
+ "grad_norm": 1.0449241399765015,
+ "learning_rate": 0.00022330464580191104,
+ "loss": 0.3832916975021362,
+ "mean_token_accuracy": 0.8744640938937664,
+ "num_tokens": 4767253.0,
+ "step": 2060
+ },
+ {
+ "epoch": 4.965600482800241,
+ "eval_entropy": 0.4897575577658214,
+ "eval_loss": 0.6547137498855591,
+ "eval_mean_token_accuracy": 0.8286678559994429,
+ "eval_num_tokens": 4767253.0,
+ "eval_runtime": 88.2716,
+ "eval_samples_per_second": 16.087,
+ "eval_steps_per_second": 2.017,
+ "step": 2060
+ },
+ {
+ "entropy": 0.38312033089724457,
+ "epoch": 5.012070006035003,
+ "grad_norm": 0.6516358256340027,
+ "learning_rate": 0.0002201905473407628,
+ "loss": 0.3343928098678589,
+ "mean_token_accuracy": 0.8923151601444591,
+ "num_tokens": 4816587.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.012070006035003,
+ "eval_entropy": 0.4274808027771082,
+ "eval_loss": 0.6996631026268005,
+ "eval_mean_token_accuracy": 0.8259488166718001,
+ "eval_num_tokens": 4816587.0,
+ "eval_runtime": 88.3757,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.014,
+ "step": 2080
+ },
+ {
+ "entropy": 0.3049557346850634,
+ "epoch": 5.060350030175015,
+ "grad_norm": 0.6272661685943604,
+ "learning_rate": 0.00021706737990689358,
+ "loss": 0.2521080255508423,
+ "mean_token_accuracy": 0.912626949697733,
+ "num_tokens": 4861071.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.060350030175015,
+ "eval_entropy": 0.41769456176945335,
+ "eval_loss": 0.7133082151412964,
+ "eval_mean_token_accuracy": 0.8254162324278542,
+ "eval_num_tokens": 4861071.0,
+ "eval_runtime": 87.9672,
+ "eval_samples_per_second": 16.142,
+ "eval_steps_per_second": 2.023,
+ "step": 2100
+ },
+ {
+ "entropy": 0.31178536619991065,
+ "epoch": 5.108630054315027,
+ "grad_norm": 0.9577748775482178,
+ "learning_rate": 0.0002139360273197436,
+ "loss": 0.24547300338745118,
+ "mean_token_accuracy": 0.9145238555967807,
+ "num_tokens": 4904742.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.108630054315027,
+ "eval_entropy": 0.42631214170643456,
+ "eval_loss": 0.7339685559272766,
+ "eval_mean_token_accuracy": 0.8219655203015617,
+ "eval_num_tokens": 4904742.0,
+ "eval_runtime": 87.9257,
+ "eval_samples_per_second": 16.15,
+ "eval_steps_per_second": 2.024,
+ "step": 2120
+ },
+ {
+ "entropy": 0.3008375624194741,
+ "epoch": 5.15691007845504,
+ "grad_norm": 0.797623336315155,
+ "learning_rate": 0.00021079737571505472,
+ "loss": 0.24592554569244385,
+ "mean_token_accuracy": 0.9159514293074608,
+ "num_tokens": 4950795.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.15691007845504,
+ "eval_entropy": 0.4180516125111098,
+ "eval_loss": 0.7242252826690674,
+ "eval_mean_token_accuracy": 0.8247456322895007,
+ "eval_num_tokens": 4950795.0,
+ "eval_runtime": 87.832,
+ "eval_samples_per_second": 16.167,
+ "eval_steps_per_second": 2.027,
+ "step": 2140
+ },
+ {
+ "entropy": 0.32739414311945436,
+ "epoch": 5.2051901025950515,
+ "grad_norm": 0.6331654191017151,
+ "learning_rate": 0.00020765231329410443,
+ "loss": 0.2587909460067749,
+ "mean_token_accuracy": 0.9127019934356213,
+ "num_tokens": 4994886.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.2051901025950515,
+ "eval_entropy": 0.43612574191575637,
+ "eval_loss": 0.7163131833076477,
+ "eval_mean_token_accuracy": 0.8249044545580831,
+ "eval_num_tokens": 4994886.0,
+ "eval_runtime": 88.184,
+ "eval_samples_per_second": 16.103,
+ "eval_steps_per_second": 2.019,
+ "step": 2160
+ },
+ {
+ "entropy": 0.31282360590994357,
+ "epoch": 5.253470126735063,
+ "grad_norm": 0.8501704931259155,
+ "learning_rate": 0.00020450173007235538,
+ "loss": 0.2543140649795532,
+ "mean_token_accuracy": 0.9109282083809376,
+ "num_tokens": 5043663.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.253470126735063,
+ "eval_entropy": 0.42737145202883176,
+ "eval_loss": 0.715088963508606,
+ "eval_mean_token_accuracy": 0.8260066037097674,
+ "eval_num_tokens": 5043663.0,
+ "eval_runtime": 88.1598,
+ "eval_samples_per_second": 16.107,
+ "eval_steps_per_second": 2.019,
+ "step": 2180
+ },
+ {
+ "entropy": 0.31767325326800344,
+ "epoch": 5.301750150875075,
+ "grad_norm": 0.808242917060852,
+ "learning_rate": 0.0002013465176275914,
+ "loss": 0.25598506927490233,
+ "mean_token_accuracy": 0.9112607099115848,
+ "num_tokens": 5087959.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.301750150875075,
+ "eval_entropy": 0.420320589723212,
+ "eval_loss": 0.7172654867172241,
+ "eval_mean_token_accuracy": 0.8260447238938192,
+ "eval_num_tokens": 5087959.0,
+ "eval_runtime": 88.1646,
+ "eval_samples_per_second": 16.106,
+ "eval_steps_per_second": 2.019,
+ "step": 2200
+ },
+ {
+ "entropy": 0.30062707886099815,
+ "epoch": 5.350030175015087,
+ "grad_norm": 0.7561016082763672,
+ "learning_rate": 0.0001981875688476119,
+ "loss": 0.24859883785247802,
+ "mean_token_accuracy": 0.9129510529339313,
+ "num_tokens": 5136121.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.350030175015087,
+ "eval_entropy": 0.4228216555346264,
+ "eval_loss": 0.722082257270813,
+ "eval_mean_token_accuracy": 0.8257333281334867,
+ "eval_num_tokens": 5136121.0,
+ "eval_runtime": 88.2664,
+ "eval_samples_per_second": 16.088,
+ "eval_steps_per_second": 2.017,
+ "step": 2220
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4150,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.1683140923486413e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 128,
+ "lora_bias": false,
+ "lora_dropout": 0.03828026524568501,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 64,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "gate_proj",
+ "v_proj",
+ "up_proj",
+ "down_proj",
+ "o_proj",
+ "q_proj",
+ "k_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '